AI Briefing

xAI, Grok Voice Transcribe 2.0 공개… 정확도 2배 향상, 가격 동결

·2026.09.18 09:00

핵심 내용

xAI가 정확도를 2배 높이고 가격은 유지한 음성 인식 모델 Grok Voice Transcribe 2.0을 출시했다.

자세히 보기

xAI가 최신 음성 인식 모델 Grok Voice Transcribe 2.0을 공개했다. 이 모델은 기존 1.0 버전 대비 전사 정확도를 2배 향상시켰으나, 가격은 동일하게 유지한다. Artificial Analysis 공개 리더보드에서 32개 스트리밍 모델 중 정확도 1위를 기록했으며, Tesla 차량 내 음성 비서 등 실제 서비스에서 검증된 audio foundation model을 기반으로 한다.

성능 및 벤치마크

내부 평가 데이터에 따르면 고객 지원 통화, 다국어 명령 등 4개 항목에서 모두 성능이 개선되었다. 특히 컨텍스트가 부족한 차량 내 짧은 명령어 인식 시 **Word Error Rate(WER)**가 20.6%에서 6.8%로 대폭 감소했다. 8kHz 전화 통화 환경에서는 테스트된 모든 모델 중 최고 성능을 달성했으며, 다국어 전사 정확도 향상이 두드러진다.

주요 기능 및 호환성

기존 Speech-to-Text API와 호환되어 코드 변경 없이 바로 적용할 수 있다. 주요 기능으로는 Batch 및 Streaming 지원, 화자 분리(Speaker diarization), 최대 8개 채널 독립 처리, 도메인 용어 보정(Key term biasing) 등이 포함된다. 또한 'um', 'uh' 같은 채워진 단어 제거와 음성 에이전트용 화자 전환 감지 기능을 제공한다.

가격 및 도입 사례

가격은 Batch 전사 시 시간당 $0.10, Streaming 전사 시 시간당 $0.20으로 책정되었으며, 화자 분리 및 타임스탬프 기능이 기본 포함된다. Atlassian Loom은 기존 솔루션보다 정확도가 높다고 판단해 Grok Voice Transcribe 2.0을 영상 전사에 도입했으며, 전사본을 Cursor로 전달해 코드 업데이트를 자동화하는 워크플로우를 구축했다. Grok Voice Transcribe 2.0은 조만간 API 기본값으로 전환되며, 1.0 버전은 수 주 내 지원 종료 예정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.