AI Briefing

NVIDIA, Nemotron 3 Diarization 공개

**Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization**

·2026.09.23 22:17

핵심 내용

NVIDIA가 Voice Arena Diarization-Bench에서 1위를 기록한 100M 파라미터 오픈 웨이트 Nemotron 3 Diarization 모델을 공개했다.

1 / 9

자세히 보기

NVIDIA가 Hugging Face 블로그를 통해 100M 파라미터 크기의 오픈 웨이트 모델 Nemotron 3 Diarization을 공개했다. 이 모델은 겹치는 대화에서 화자 타임스탬프를 식별하여 ASR과 결합 시 화자별 전사본 생성을 지원하며, 최대 8명의 화자를 지원한다.

성능 및 벤치마크

Voice Arena Diarization-Bench 초기 결과에서 **DER 14.72%**로 12개 시스템 중 1위를 기록했다. 이는 2위 시스템(19.3%) 대비 약 **24%**의 상대적 오류율 감소이다. 기존 baseline 대비 DIHARD III DER을 19.09%에서 12.73%로 낮추고, 배치 처리량(RTxF)을 크게 향상시켰다. 다만, Voice Arena의 최종 평가 및 통계 분석에 따라 결과가 변경될 수 있다.

아키텍처 및 처리 방식

16kHz 모노 오디오를 처리하며, Sortformer 방식을 채택해 첫 등장 순서대로 화자 채널을 할당한다. AOSC와 FIFO 큐를 통해 스트리밍 중 라벨 안정성을 확보하며, 출력은 실제 신원이 아닌 익명 채널 ID와 메타데이터로 제공된다.

처리량 및 제약 사항

배치 크기 32, torch.compile() 환경에서 30.4초 구성 시 RTFx 15,113x를 기록했다. 1.04초 구성에서는 RTFx 865x를 기록하며 DER을 19.60%에서 13.18%로 낮췄다. Argmax Pro SDK 3가 이 모델을 지원하며, 최대 8화자까지의 실시간 화자 귀속을 제공한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.