DeepSeek V4 - 프런티어에 거의 도달했지만 가격은 훨씬 저렴
DeepSeek이 1M token 컨텍스트 V4 프리뷰 2종을 공개하고 저가 전략을 내세웠다.
DeepSeek이 V4 시리즈의 첫 프리뷰 모델인 DeepSeek-V4-Pro와 DeepSeek-V4-Flash를 공개했다. 두 모델은 모두 1M token 컨텍스트를 지원하는 Mixture of Experts(MoE) 구조이며, MIT 라이선스로 배포된다.
- V4-Pro: 총 1.6T 파라미터, 활성 49B
- V4-Flash: 총 284B 파라미터, 활성 13B
크기와 범용성에서도 눈에 띈다. Pro는 Hugging Face 기준 865GB, Flash는 160GB이며, 저자는 Pro가 현재 가장 큰 open weights 모델로 보인다고 본다. DeepSeek V3.2보다 훨씬 크고, Flash는 128GB M5 MacBook Pro에서 경량 양자화로 돌 수 있길 기대했으며, Pro도 필요한 활성 expert만 디스크에서 스트리밍하면 가능성이 있다고 봤다.
OpenRouter로 펠리칸이 자전거를 타는 SVG를 생성해 본 결과, Flash는 자전거 구조와 포즈가 꽤 안정적이었고 Pro는 전반적으로는 괜찮지만 펠리칸 표현이 다소 어색했다. 하지만 핵심은 시연보다도 가격이다.
- Flash: 입력 $0.14/M, 출력 $0.28/M
- Pro: 입력 $1.74/M, 출력 $3.48/M
Flash는 GPT-5.4 Nano보다도 저렴하고, Pro는 대형 프런티어 모델 가운데 가장 저렴한 축에 속한다. 논문은 1M token 환경에서 Pro가 DeepSeek V3.2 대비 single-token FLOPs의 **27%**와 KV cache의 **10%**만 쓰고, Flash는 각각 10%, **7%**로 더 낮춘다고 설명한다.
자체 벤치마크에서는 Pro가 경쟁력을 보이지만, 더 확장된 DeepSeek-V4-Pro-Max는 GPT-5.2와 Gemini-3.0-Pro를 앞서면서도 GPT-5.4와 Gemini-3.1-Pro에는 약간 못 미친다. DeepSeek은 최신 프런티어 모델과의 격차를 약 3~6개월로 봤고, 저자는 곧 나올 Unsloth 양자화 버전을 기다리고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.