Hugging Face, 로컬 음성 대화 파이프라인 'Speech To Speech' 공개
·2026.08.22 09:30
핵심 내용
Hugging Face가 VAD, STT, LLM, TTS를 연결한 로컬 음성 대화 파이프라인을 공개했다.
자세히 보기
Hugging Face가 오픈소스 모델을 활용해 로컬 환경에서 완전한 음성 대화 파이프라인을 구성할 수 있는 Speech To Speech 프로젝트를 공개했다.
이 파이프라인은 사용자가 발화하면 VAD(Voice Activity Detection)로 음성을 감지하고, STT(Speech-to-Text)로 텍스트를 변환한 뒤, LLM이 답변을 생성하고 TTS(Text-to-Speech)로 음성을 출력하는 4단계 흐름으로 작동한다.
각 단계는 별도의 스레드에서 동작하며 큐로 연결되어 처리 지연을 최소화하고 효율적인 병렬 처리를 지원한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.