AI Briefing

Audio8-ASR-Infinite: 24시간 무중단 스트리밍 ASR, 지연 시간 조절 가능

Edge0/Audio8-ASR-Infinite

·2026.09.24 23:50

음성 인식 지연 시간을 240ms부터 560ms까지 자유롭게 조절할 수 있는 스트리밍 모델이다. 오디오 클록을 80ms, 120ms, 160ms 중 선택해 인식 속도와 자원 소모의 균형을 맞출 수 있다.

Rolling KV Cache 기술을 적용해 메모리 사용량과 지연 시간을 일정하게 유지한다. 기본 컨텍스트 길이가 30초임에도 불구하고 24시간 연속으로 끊김 없이 전사 작업을 수행한다.

기존 어쿠스틱 VAD가 구분하기 어려웠던 사고 중의 침묵, 더듬거림, 실제 발화 종료를 구별하는 Semantic VAD를 탑재했다. 중국어와 영어를 지원하며, vLLM을 통해 실시간 추론이 가능하다.

Voxtral Realtime 아키텍처와 Qwen2.5-3B-Instruct 디코더를 결합해 성능을 확보했다. Apache 2.0 라이선스로 배포되며, 현재는 전사 기능이 포함된 프리뷰 버전이다.

HuggingFace
HuggingFace 모델

Edge0/Audio8-ASR-Infinite

원문에 등록된 설명이 없습니다.

automatic-speech-recognition

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.