NVIDIA, DeepSeek-V4-Pro-0813의 NVFP4 양자화 모델 공개
핵심 내용
NVIDIA가 DeepSeek-V4-Pro-0813의 NVFP4 양자화 버전을 공개하며, 총 1.65조 파라미터 중 4천억 파라미터를 활성화하는 MoE 구조를 지원한다.
자세히 보기
NVIDIA가 DeepSeek-V4-Pro-0813의 NVFP4 양자화 모델을 공개했다. 이 모델은 NVIDIA의 Model Optimizer를 통해 양자화되었으며, 상업적 및 비상업적 사용이 모두 허용된다.
아키텍처 및 성능
원본 모델인 DeepSeek-V4-Pro-0813은 Mixture-of-Experts (MoE) 구조의 자기회귀 언어 모델로, Compressed Sparse Attention과 Heavily Compressed Attention을 결합한 하이브리드 어텐션 메커니즘을 사용한다. 총 파라미터 수는 **1.65조(1.65T)**에 달하지만, 추론 시 활성화되는 파라미터는 **4천억(400B)**으로 효율성을 높였다. 또한 Manifold-Constrained Attention과 DSpark speculative decoding 모듈이 포함되어 에이전트 성능과 추론 속도를 강화했다.
입력 및 출력 특성
이 모델은 텍스트 입력을 지원하며, 시스템 프롬프트와 다중 턴 대화를 처리할 수 있다. 출력은 텍스트, 구조화된 JSON, 함수 호출(function calling) 등을 지원한다. 특히 reasoning effort 설정을 통해 추론 깊이를 조절할 수 있으며, 수학, 소프트웨어 엔지니어링, 복잡한 문제 해결 등 고난도 작업에 최적화되어 있다. NVIDIA GPU 가속 환경에서 실행되도록 설계되어 CUDA 코어와 관련 라이브러리를 통해 성능을 극대화한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.