NVIDIA의 실시간 Full-Duplex 음성 모델
·2026.08.05 09:00
NVIDIA가 450ms 응답과 tool calling을 지원하는 11B 음성 모델을 공개했다.
NVIDIA NemotronLabs VoiceChat 11B는 음성 이해와 생성을 하나의 모델에서 스트리밍으로 처리하는 end-to-end Full-Duplex 음성 모델이다. 기존 ASR→LLM→TTS 구조와 달리 모델 간 연결과 API handoff를 줄여 약 450ms의 turn-taking latency를 목표로 한다.
주요 기능은 다음과 같다.
- 자연스러운 turn-taking과 실시간 음성 생성
- 사용자가 끼어들면 즉시 발화를 멈추는 barge-in
- 대화 흐름을 유지하면서 실행하는 실시간 tool calling
- Tool 호출 직후 말할 수 있는 맞춤형 on-hold 메시지
구조는 Fast Conformer Speech Encoder, Nemotron Nano v2 9B LLM backbone, NVIDIA TTS decoder 및 codec으로 구성된다. 음성 신호를 오디오 토큰으로 변환한 뒤 LLM이 텍스트 토큰을 예측하고, TTS decoder가 음성 코드를 생성한다. Tool calling script는 별도의 출력 채널에서 예측한다.
이 모델은 공개 Full-Duplex 모델 가운데 최초로 tool calling을 지원한다고 소개됐으며, VoiceBench의 open Full-Duplex 부문에서 2위를 기록했다. 연구 목적의 사용만 허용되며, 이용 조건은 OpenMDW License Agreement 1.1을 따른다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.