NVIDIA, 오디오-텍스트 통합 LLM Audex-30B 공개
nvidia/Nemotron-Labs-Audex-30B-A3B · Hugging Face
·2026.07.07 16:12
NVIDIA가 텍스트와 오디오를 동시에 처리하는 MoE 기반의 통합 멀티모달 모델 Audex-30B를 출시했다.
NVIDIA가 Nemotron-Cascade-2-30B-A3B를 기반으로 구축한 새로운 통합 오디오-텍스트 LLM인 Audex-30B-A3B를 공개했습니다. 이 모델은 30B 파라미터 규모의 MoE(Mixture-of-Experts) 구조를 가지며, 실제 연산에는 3B의 활성 파라미터만 사용하여 효율성을 높였습니다.
주요 특징 및 기능:
- 멀티모달 능력: 음성 및 일반 오디오 입력을 위한 오디오 인코더와 텍스트/오디오 출력을 위한 이산 오디오 토큰 어휘집을 확장하여 구현되었습니다.
- 광범위한 오디오 작업: 오디오 이해, 음성 인식 및 번역, TTS(Text-to-Speech), 오디오 생성, 그리고 Speech-to-Speech 생성 기능을 모두 지원합니다.
- 성능 유지: 기존 텍스트 전용 모델이 가진 추론, 정렬(Alignment), 지식, 긴 문맥(Long-context), 에이전트 능력을 거의 저하시키지 않으면서 오디오 기능을 통합했습니다.
- 기술 사양: 최대 1M 토큰의 컨텍스트 길이를 지원하며,
<think>태그를 활용한 Thinking 모드와 일반 Instruct 모드를 모두 지원합니다.
NVIDIA는 이와 더불어 더 작은 규모의 모델인 Nemotron-Labs-Audex-2B도 함께 제공하고 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.