AI Briefing

NVIDIA Nemotron 3 Nano Omni: 문서·오디오·비디오용 긴 컨텍스트 멀티모달 지능

·2026.04.29 02:00

NVIDIA가 문서·오디오·비디오를 다루는 멀티모달 모델 Nemotron 3 Nano Omni를 공개했다.

NVIDIA Nemotron 3 Nano Omni는 텍스트·이미지·비디오·오디오를 함께 처리하는 오픈 멀티모달 모델이다.

  • 문서 이해에서 OCRBenchV2-En 65.8, MMLongBench-Doc 57.5, CharXiv reasoning 63.6을 기록했고, 긴 문서·표·수식·다중 페이지 참고를 겨냥했다.
  • 비디오·오디오 쪽에서는 Video-MME 72.2, WorldSense 55.4, DailyOmni 74.1, VoiceBench 89.4, HF Open ASR 5.95를 제시했다.
  • GUI 작업에서도 OSWorld 47.4를 달성했으며, 문서와 비디오 유스케이스에서 기존 오픈 omni 모델 대비 시스템 효율을 각각 7.4배, 9.2배 높였다고 밝혔다.

구조는 Nemotron 3 hybrid Mamba-Transformer MoE 백본에 C-RADIOv4-H 비전 인코더와 Parakeet-TDT-0.6B-v2 오디오 인코더를 붙인 형태다. 이미지에는 동적 해상도 처리와 최대 13,312 비주얼 패치, 비디오는 Conv3D tubelet embeddingEVS로 토큰을 줄이는 방식을 적용했다.

오디오는 16kHz 입력을 사용하며, 학습 입력은 최대 1,200초(20분), LLM 컨텍스트는 5시간 이상을 지원한다. SFT는 H100에서 진행됐고, 후반 RL은 NeMo-RLNeMo Gym을 사용해 B200/H100 클러스터에서 수행했다. 체크포인트는 BF16, FP8, NVFP4로 HuggingFace에 공개됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.