AI Briefing

xAI, Grok STT와 TTS API 출시

·2026.04.20 09:00

핵심 내용

xAI가 실시간·배치 음성 인식과 음성 합성 API를 출시했다.

자세히 보기

xAI가 **Grok Speech to Text(STT)**와 Grok Text to Speech(TTS) 두 개의 독립형 audio API를 공개했다. Grok Voice, Tesla 차량, Starlink 고객 지원에 쓰는 같은 스택을 기반으로 하며, 음성 에이전트와 실시간 전사, 접근성, 팟캐스트, 인터랙티브 audio 경험에 바로 붙일 수 있도록 설계했다.

STT는 대용량 audio 파일을 REST API로 밀리초 단위에 전사하고, 실시간 처리는 가장 낮은 지연을 목표로 한 WebSocket API로 제공한다. 여기에 word-level timestamps, speaker diarization, multichannel support를 넣었고, 숫자·날짜·통화 등을 문맥에 맞게 정규화하는 Inverse Text Normalization도 지원한다.

성능 측면에서는 전화 통화, 회의, 영상/팟캐스트, 텔레포니 등에서 상용 모델과 비교한 결과를 제시했다. 표에서는 전체 **Word Error Rate(WER)**가 Grok STT **6.9%**로 나타났고, 전화 통화 엔티티 인식에서는 **5.0%**를 기록해 ElevenLabs, Deepgram, AssemblyAI보다 낮다고 주장했다. 또한 25+ languages를 지원하고, 실시간과 녹음된 audio 모두에서 화자 분리를 처리할 수 있다고 밝혔다.

TTS는 자연스럽고 표현력 있는 음성을 목표로 하며, 긴 텍스트 변환용 REST API와 실시간 생성을 위한 WebSocket API를 제공한다. [laugh], [sigh], [whisper], , , 같은 speech tags로 억양과 감정을 세밀하게 제어할 수 있고, 가격은 1백만 characters당 $4.20로 책정됐다.

요금은 STT가 배치 $0.10/hour, 스트리밍 $0.20/hour이며, xAI API console에서 rate limit과 세부 조건을 확인할 수 있다. xAI는 이를 통해 음성 입력과 출력이 모두 필요한 제품에서 별도 음성 인프라 없이 바로 통합 가능한 패키지를 내세우고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.