AI Briefing

추천Nemotron-3-Diarization: 80ms 지연으로 8명 화자 구분하는 실시간 화자 분리

nvidia/Nemotron-3-Diarization

·2026.09.24 17:50

누가 언제 말했는지 파악하는 화자 분리 작업을 실시간으로 처리한다. 최대 8명의 화자를 구분하며, 스트리밍과 오프라인 추론을 모두 지원해 회의록 작성이나 라이브 방송 분석에 적합하다.

입력 버퍼 지연을 80ms까지 낮출 수 있어 즉각적인 응답이 필요한 환경에서도 작동한다. Arrival-Order Speaker Cache 기법을 적용해 이전 청크의 화자 정보를 유지하므로, 긴 오디오에서도 화자 식별이 흔들리지 않는다.

NeMo-Speech.cpp 런타임을 통해 C++ 기반의 경량 실행이 가능하며, ASR 파이프라인과 연동해 단어 단위 화자 태그를 붙일 수 있다. 30.4초 버퍼의 오프라인 모드부터 0.32초 버퍼의 초저지연 모드까지 설정을 유연하게 조정할 수 있다.

HuggingFace
HuggingFace 모델

nvidia/Nemotron-3-Diarization

원문에 등록된 설명이 없습니다.

voice-activity-detection

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.