Microsoft, 새 MAI Realtime 음성 모델 테스트
Microsoft가 MAI Playground에서 실시간 양방향 음성 모델 MAI Realtime을 시험하고 있다.
Microsoft가 MAI Playground에서 첫 자체 실시간 음성 모델로 보이는 MAI Realtime을 일부 파트너에게 공개하고 테스트 중이다. 이 모델은 사용자의 말을 들으면서 동시에 응답하는 full-duplex 방식으로, OpenAI의 GPT Live 1이나 Sesame와 경쟁하는 형태다.
현재 Victoria와 Grant 두 가지 음성을 제공하며, Copilot 음성 모드보다 자연스러운 응답을 지원한다. 영어, 독일어, 스페인어, 프랑스어, 이탈리아어, 포르투갈어, 일본어, 한국어, 중국어 등 17개 언어를 지원하고 대화 중 언어가 바뀌어도 자동으로 대응한다.
대화의 발화 전환 방식은 다음 두 가지로 설정할 수 있다.
- Switchboard 모드: MAI-Ears endpointer와 인라인 제어 토큰을 사용한다.
- 결정론적 모드: 무음 기반 endpointing과 Whisper semantic endpointer를 조합한다.
두 방식의 실제 차이는 크지 않지만, 끼어들기 처리가 자연스럽고 응답 지연 시간도 짧은 것으로 알려졌다. 노래나 비음성 효과음은 생성하지 않아 범용 오디오 생성기보다는 대화형 음성 시스템에 초점을 맞췄다.
MAI Playground의 디버그 패널에서는 실시간 latency 수치와 모델의 처리 과정, 내부 사고 과정을 확인할 수 있다. 향후 접근 대상이 확대되면 Playground 사용자가 샘플을 공유하는 기능도 제공될 전망이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.