딥시크, V4.1 플래시 모델 공개… 72시간 지속 분산 캐시로 토큰 단가 파괴
- 중국 딥시크(DeepSeek)가 차세대 경량 고성능 모델 'DeepSeek-V4.1-Flash'를 공식 출시하고, 오프피크 캐시 입력 비용을 100만 토큰당 0.003달러라는 파격적 수준으로 인하했다.
- 호스트 DRAM의 10%를 분산 메모리 풀로 활용하는 하이브리드 캐싱 아키텍처를 도입해 글로벌 KV 캐시 수명을 72시간 이상 안정적으로 보장한다.
- 기존 상위 모델(V4 Pro)의 벤치마크 점수를 뛰어넘으면서도 비용을 극적으로 낮춰 엔터프라이즈 AI 추론 시장의 가격 경쟁을 가속화하고 있다.

[보도 기사 본문]
중국 인공지능 혁신 기업 딥시크(DeepSeek)가 차세대 초경량·고성능 인공지능 모델 'DeepSeek-V4.1-Flash'를 공식 출시하고 API 서비스를 전면 개편했다. 딥시크는 이번 신규 모델을 단순한 보급형 경량 모델이 아닌 자사 API의 차세대 핵심 중심축으로 정의했으며, 오프피크 시간대 캐시 입력 비용을 100만 토큰당 0.003달러(약 4원)로 책정하는 전례 없는 가격 파괴를 단행했다고 벤처비트(VentureBeat) 등이 보도했다.
이번 V4.1-플래시의 핵심 기술적 진보는 고도화된 하이브리드 키-값(KV) 캐싱 아키텍처에 있다. 딥시크 기술 보고서에 따르면 전역(Global) KV 캐시는 영구 저장 계층에서 최소 72시간 이상의 수명을 보장받는다. 반면 단기 슬라이딩 윈도우 어텐션(SWA) 상태는 호스트 서버 DRAM의 10%로 프로비저닝된 분산 메모리 풀에 분산 저장되어 실시간 메모리 입출력 병목을 극적으로 해소했다.
특히 분산 메모리 풀에서 단기 SWA 상태가 만료되더라도, 영구 보존된 글로벌 캐시와 결합해 전체 대화 이력을 처음부터 다시 연산할 필요 없이 가장 최근의 어텐션 윈도우만을 신속하게 재생(Replay)하는 상태 복원 알고리즘을 구현했다. 이를 통해 긴 문맥을 유지해야 하는 멀티턴 에이전트 작업에서도 캐시 히트율을 극대화하고 연산 낭비를 원천 차단했다.
벤치마크 평가에서도 V4.1-플래시는 기존 플래그십 모델이었던 V4 Pro를 성능, 응답 속도, 추론 비용 전 부문에서 포괄적으로 능가하는 것으로 나타났다. 딥시크는 기존 V4 Pro로 인입되던 API 요청을 V4.1-플래시로 자동 라우팅하도록 정책을 전환했으며, 코딩 및 복합 추론 영역에서 미국 빅테크의 프론티어급 모델(GPT-5, 클로드 오퍼스 5 등)과 대등하거나 일부 과제에서 앞서는 성능을 기록했다.
클라우드 및 AI 인프라 업계에서는 딥시크의 이번 발표가 모델 자체의 지능 경쟁을 넘어 '캐싱 인프라 최적화를 통한 토큰 경제학 혁신'이 가속화되고 있음을 보여준다고 평가했다. 토큰 처리 비용이 사실상 0에 수렴하는 수준으로 낮아짐에 따라 대규모 자율형 에이전트와 장기 추론 워크플로를 도입하려는 글로벌 기업들의 비용 장벽이 획기적으로 낮아질 전망이다.
[원문 출처]
- 보도 매체: DeepSeek Official, VentureBeat Technology
- 기사 제목: DeepSeek-V4.1-Flash debuts with $0.003/1M off-peak cached-input rate and benchmarks eclipsing frontier models
- 발행 일시: 2026년 9월




