NVIDIA, 효율성 극대화한 Nemotron-3 Puzzle 공개
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16 · Hugging Face
·2026.07.07 20:32
NVIDIA가 추론 효율성을 대폭 개선한 MoE 기반의 Nemotron-3 Puzzle-75B 모델을 출시했다.
NVIDIA가 Iterative Puzzle 압축 프레임워크를 적용하여 추론 효율성을 극대화한 Nemotron-Labs-3-Puzzle-75B-A9B 모델을 공개했습니다. 이 모델은 기존 Nemotron-3-Super-120B-A12B를 기반으로 개발되었습니다.
주요 특징은 다음과 같습니다:
- 하이브리드 MoE 아키텍처: Mamba, MoE, Attention 레이어가 결합된 구조를 채택했습니다.
- 압축 및 효율성: 전체 파라미터를 120.7B에서 75.3B로, 활성 파라미터를 12.8B에서 9.3B로 줄여 추론 성능을 높였습니다.
- 성능 향상: 단일 8×B200 노드에서 서버 처리량(Throughput)을 약 2배 향상시켰으며, 단일 H100에서의 1M 토큰 동시 처리 능력을 1개에서 8개로 확장했습니다.
- 다국어 및 기능: 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 스페인어, 중국어를 지원하며 추론, 코딩, 에이전트 작업에서 강력한 성능을 유지합니다.
해당 모델은 상업적 이용이 가능하도록 설계되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.