Confucius4-R2T2: 200ms 지연으로 텍스트 확정 출력하는 실시간 음성 인식
netease-youdao/Confucius4-R2T2
·2026.09.21 14:48
프로젝트 소개
음성 인식 중 이미 출력된 텍스트가 수정되지 않는 'append-only' 방식을 채택했다. 80ms부터 2초까지 조절 가능한 디코딩 청크를 통해 평균 200~600ms의 낮은 지연 시간을 보장한다.

Qwen3-ASR 기반의 파인튜닝 모델로, Longest Stable Prefix 학습 패러다임을 적용해 안정된 접두어만 즉시 방출한다. 실시간 자막 생성이나 LLM 에이전트 파이프라인에서 텍스트 플리커링 없이 즉각적인 데이터 처리가 가능하다.
스트리밍 기능 추가에도 오프라인 인식 정확도를 유지하며, 영어와 중국어에서 SOTA급 성능을 기록한다. vLLM 백엔드를 지원해 높은 처리량을 요구하는 환경에서도 안정적으로 구동된다.
HuggingFace 모델
netease-youdao/Confucius4-R2T2
원문에 등록된 설명이 없습니다.
automatic-speech-recognition
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.