추천Nemotron-3-Diarization: 80ms 지연으로 8명 화자 구분하는 실시간 화자 분리
nvidia/Nemotron-3-Diarization
·2026.09.24 17:50
프로젝트 소개
누가 언제 말했는지 파악하는 화자 분리 작업을 실시간으로 처리한다. 최대 8명의 화자를 구분하며, 스트리밍과 오프라인 추론을 모두 지원해 회의록 작성이나 라이브 방송 분석에 적합하다.

입력 버퍼 지연을 80ms까지 낮출 수 있어 즉각적인 응답이 필요한 환경에서도 작동한다. Arrival-Order Speaker Cache 기법을 적용해 이전 청크의 화자 정보를 유지하므로, 긴 오디오에서도 화자 식별이 흔들리지 않는다.
NeMo-Speech.cpp 런타임을 통해 C++ 기반의 경량 실행이 가능하며, ASR 파이프라인과 연동해 단어 단위 화자 태그를 붙일 수 있다. 30.4초 버퍼의 오프라인 모드부터 0.32초 버퍼의 초저지연 모드까지 설정을 유연하게 조정할 수 있다.
HuggingFace 모델
nvidia/Nemotron-3-Diarization
원문에 등록된 설명이 없습니다.
voice-activity-detection
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.