AI Briefing

블랙웰, DeepSeek V4 즉시 지원

NVIDIA Beats Everyone To DeepSeek V4 With Day-0 Blackwell Support, Pushing 3,500 Tokens Per Second On 1.6T Models

·2026.04.26 21:34

NVIDIA가 DeepSeek V4에 Blackwell Day-0 지원과 초당 3,500TPS 성능을 공개했다.

DeepSeek V4가 공개되며 1M 토큰 컨텍스트1.6T 파라미터급 모델 구성이 제시됐다.

  • DeepSeek-V4-Pro: 총 1.6T, 활성 파라미터 49B
  • DeepSeek-V4-Flash: 총 284B, 활성 파라미터 13B
  • 두 모델 모두 1M 토큰 컨텍스트를 지원하고, API 문서 기준 최대 출력 길이는 384K 토큰이다.

모델 효율도 크게 줄었다. 기사에 따르면 새 버전은 단일 토큰 추론 FLOPs를 **27%**로 낮췄고, 1M 토큰 컨텍스트에서 KV cache 사용량도 10% 수준으로 줄였다.

NVIDIA는 Blackwell GPU와 NVFP4를 앞세운 Day-0 지원을 내놨다. 공식 자료에서는 GB300 또는 Blackwell Ultra 기준 GPU당 약 3,500 TPS를 제시했고, 이 수치는 추가 최적화로 더 올라갈 수 있다고 설명했다.

핵심 최적화 포인트로는 FP4(MXFP4) 양자화, Dynamo, CUDA 커널 최적화, 병렬화 기법 등이 거론됐다. FP4는 롤아웃과 추론 단계의 메모리 트래픽과 샘플링 지연을 줄이는 용도로 쓰인다.

기사 말미에서는 Huawei Ascend 950PR과 950DT가 MXFP4 명령을 지원할 예정이라고 언급하며, DeepSeek V4가 중국산 AI 칩 생태계에도 맞춰질 가능성을 시사했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.