AI Briefing

llama.cpp, NVIDIA Nemotron-3-Puzzle-75B-A9B 모델 지원 추가

·2026.09.03 16:35

핵심 내용

llama.cpp가 NVIDIA의 하이브리드 MoE 구조를 채택한 Nemotron-3-Puzzle-75B-A9B 모델 실행을 지원한다.

자세히 보기

llama.cpp 프로젝트에 NVIDIA의 Nemotron-3-Puzzle-75B-A9B 모델 지원이 추가되었다. 이 모델은 75B MoE 아키텍처를 적용하여 현재 실행이 가능하며, 아직 MTP(Multi-Token Prediction) 기능은 지원하지 않는다.

모델 아키텍처 및 특징

  • 하이브리드 구조: Mamba, MoE, Attention 레이어가 교대로 배치된 하이브리드 MoE 아키텍처를 사용한다.
  • MTP 지원 계획: 상위 모델인 Nemotron-3-Super와 마찬가지로 텍스트 생성 속도를 높이기 위한 MTP 기능을 지원하도록 설계되었으나, llama.cpp에서는 아직 구현되지 않았다.
  • 파라미터 효율성: 부모 모델 대비 총 파라미터 수를 120.7B에서 75.3B로, 활성 파라미터 수를 12.8B에서 9.3B로 줄여 경량화했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.