AI Briefing

NVIDIA, 비전·오디오·언어를 통합한 Nemotron 3 Nano Omni 공개, AI 에이전트 효율 최대 9배

·2026.04.29 01:00

NVIDIA가 비전·오디오·언어를 통합한 Nemotron 3 Nano Omni를 공개했다.

NVIDIANemotron 3 Nano Omni를 공개했다. 비전, 오디오, 텍스트를 하나로 묶은 오픈 멀티모달 모델로, 여러 모델을 오가며 생기던 지연과 문맥 손실을 줄여 AI 에이전트의 응답 속도와 정확도를 높인다. NVIDIA는 이 모델이 복잡한 문서 인텔리전스와 비디오·오디오 이해에서 6개 리더보드를 선도했다고 밝혔다.

핵심은 30B-A3B 하이브리드 Mixture-of-Experts(MoE) 구조다. vision과 audio encoder를 통합해 별도 인식 모델을 대체하고, 같은 수준의 상호작용을 유지하는 다른 오픈 omni 모델보다 최대 9배 높은 throughput을 제공한다고 설명했다. 고객지원, 금융 문서 처리, 컴퓨터 사용 에이전트, 오디오-비디오 reasoning 같은 워크플로에 맞춰 설계됐다.

배포와 커스터마이징 범위도 넓다. open weights, 데이터셋, 학습 기법을 함께 제공하고, NVIDIA NeMo로 도메인별 최적화와 평가를 수행할 수 있다. 모델은 Hugging Face, OpenRouter, build.nvidia.comNIM microservice와 NVIDIA Cloud Partners, 인퍼런스 플랫폼, 클라우드 서비스에서 제공되며, DGX SparkDGX Station부터 데이터센터와 클라우드까지 동일한 흐름으로 배포할 수 있다.

  • H Company는 이 모델을 이용해 1920×1080 해상도의 화면 녹화를 빠르게 해석하는 컴퓨터 사용 에이전트를 구현했다.
  • Aible, ASI, Eka Care, Foxconn, Palantir, Pyler가 이미 채택했고, Dell Technologies, DocuSign, Infosys, K-Dense, Lila, Oracle, Zefr는 평가 중이다.
  • 필요에 따라 Nemotron 3 SuperUltra, 또는 다른 proprietary models와 조합해 서브 에이전트 워크플로를 구성할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.