AI Briefing
추천

DeepSeek, V4.1-Flash 공개… V4-Pro 대체 및 KV 캐시 최적화

DeepSeek-V4.1-Flash, KV 캐시를 토큰당 890바이트로 줄이고 플래그십 V4-Pro를 대체하는 552B 규모의 MoE 모델

·2026.09.11 14:00

핵심 내용

DeepSeek이 552B MoE 모델 V4.1-Flash를 공개해 V4-Pro를 대체하고 KV 캐시를 토큰당 890바이트로 최적화했다.

1 / 8

자세히 보기

DeepSeek이 2026년 9월 10일, 552B 파라미터 규모의 MoE 멀티모달 모델 V4.1-Flash를 공개했다. 이 모델은 기존 플래그십인 V4-Pro를 대체하며, KV 캐시를 토큰당 890바이트로 줄여 비용 구조를 대폭 개선했다. 이는 V4-Flash의 1/4, V1의 1/437 수준이다.

아키텍처 및 기술 혁신

  • Causal Encoder-Decoder(CED): 프리필 연산량을 O(NL/2)로 줄이고, 인코더와 디코더를 분리하여 효율성을 높였다.
  • CSA2 압축: 항목, 시퀀스, 레이어 3축에서 동시 압축을 수행하며, 계층적 희소 인덱서를 통해 블록 후보 풀을 제한한다.
  • SWA 및 FP4 KV: 마지막 128토큰만 재사용하는 Bounded Replay와 NVFP4 기반 양자화를 적용해 메모리 사용량을 최소화했다.
  • Engram 및 DSpark: 196B 파라미터의 Engram 모듈과 3블록 슬라이딩 윈도우 기반의 DSpark 초안 생성기를 통해 추론 속도를 향상시켰다.

성능 및 벤치마크 결과

  • 연산 효율: 컨텍스트 길이가 4K에서 1M으로 256배 증가해도 디코드 FLOPs는 1/4만 증가한다.
  • 벤치마크: TB2.1 90.6%, DeepSWE 74.2%, Codeforces 3471점 등으로 Opus 5 및 GPT-5.6 Sol을 추월했다고 주장한다. 다만, 고난도 추론이나 도구 사용 없는 HLE 등에서는 열세를 보인다.
  • 다국어 성능: 한국어 토큰 효율이 중국어 대비 약 1.4배 불리하며, MultiLoKo 45.5, MGSM 80.2로 다국어 성능에 약점이 있다.

배포 및 인프라

  • API 및 비용: deepseek-flash API는 V4-Pro 대비 캐시 적중 시 입력 7.3배, 출력 3.3배 저렴하다. 2026년 9월 14일부터 V4-Pro는 V4.1-Flash로 라우팅된다.
  • 오픈 소스: 가중치는 MIT 라이선스로 Hugging Face에 공개되며, 상업적 사용 및 수정이 자유롭다.
  • 한계점: 단순화된 아키텍처로 인해 극단적인 입력에서 능력 저하가 발생할 수 있으며, 벤치마크 점수 근접이 프론티어 모델과의 완전한 대등을 의미하지는 않는다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.