NVIDIA, Nemotron 3 Diarization 공개
**Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization**
핵심 내용
NVIDIA가 Voice Arena Diarization-Bench에서 1위를 기록한 100M 파라미터 오픈 웨이트 Nemotron 3 Diarization 모델을 공개했다.
자세히 보기
NVIDIA가 Hugging Face 블로그를 통해 100M 파라미터 크기의 오픈 웨이트 모델 Nemotron 3 Diarization을 공개했다. 이 모델은 겹치는 대화에서 화자 타임스탬프를 식별하여 ASR과 결합 시 화자별 전사본 생성을 지원하며, 최대 8명의 화자를 지원한다.
성능 및 벤치마크
Voice Arena Diarization-Bench 초기 결과에서 **DER 14.72%**로 12개 시스템 중 1위를 기록했다. 이는 2위 시스템(19.3%) 대비 약 **24%**의 상대적 오류율 감소이다. 기존 baseline 대비 DIHARD III DER을 19.09%에서 12.73%로 낮추고, 배치 처리량(RTxF)을 크게 향상시켰다. 다만, Voice Arena의 최종 평가 및 통계 분석에 따라 결과가 변경될 수 있다.
아키텍처 및 처리 방식
16kHz 모노 오디오를 처리하며, Sortformer 방식을 채택해 첫 등장 순서대로 화자 채널을 할당한다. AOSC와 FIFO 큐를 통해 스트리밍 중 라벨 안정성을 확보하며, 출력은 실제 신원이 아닌 익명 채널 ID와 메타데이터로 제공된다.
처리량 및 제약 사항
배치 크기 32, torch.compile() 환경에서 30.4초 구성 시 RTFx 15,113x를 기록했다. 1.04초 구성에서는 RTFx 865x를 기록하며 DER을 19.60%에서 13.18%로 낮췄다. Argmax Pro SDK 3가 이 모델을 지원하며, 최대 8화자까지의 실시간 화자 귀속을 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.