AI Gateway에서 실시간 음성, 스피치 및 전사 기능 지원 시작
·2026.06.29 09:00
Vercel AI Gateway가 실시간 음성 에이전트, TTS, STT 기능을 지원하며 AI SDK 7을 통해 베타 제공된다.
Vercel의 AI Gateway가 음성 및 오디오 모델 지원을 시작했습니다. 이제 개발자는 실시간 음성 에이전트를 구축하거나, 텍스트를 음성으로 변환(TTS)하고, 오디오를 텍스트로 전사(STT)하는 기능을 구현할 수 있습니다.
이번 업데이트를 통해 기존 텍스트, 이미지, 비디오 모델과 동일하게 관측성(Observability), 비용 제어(Spend controls), BYOK(Bring-Your-Own-Key) 기능을 제공하며, 별도의 마크업이나 플랫폼 수수료가 부과되지 않습니다. 해당 기능은 현재 베타 버전이며 AI SDK 7을 통해 사용할 수 있습니다.
주요 기능은 다음과 같습니다:
- 실시간 음성 에이전트(Realtime voice agents): 저지연 대화를 통해 사용자의 말을 듣고 즉각적으로 응답하며, 대화 도중 도구(Tools)를 호출하여 작업을 수행할 수 있습니다.
- Text to Speech (TTS): 선택한 목소리와 MP3 등의 출력 형식을 사용하여 텍스트를 음성으로 생성합니다.
- Speech to Text (STT): 파일 버퍼, base64 문자열 또는 URL을 통해 오디오 녹음본을 텍스트로 전사합니다.
개발자는 AI SDK의 useRealtime 훅을 사용하여 마이크 캡처와 오디오 재생을 간편하게 관리할 수 있으며, 코드를 작성하지 않고도 AI Gateway Playground에서 모델과 직접 대화하며 기능을 테스트해 볼 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.