Google, Gemini 3.8 Live와 3.5 Transcribe 공개... 실시간 음성 AI 성능 강화
핵심 내용
Google이 실시간 음성 대화와 고정밀 전사를 지원하는 Gemini 3.8 Live와 3.5 Transcribe를 공개했다.
자세히 보기
Google이 Gemini 3.8 Live와 Gemini 3.5 Transcribe를 공개하며 실시간 음성 우선(real-time, voice-first) 애플리케이션 개발을 지원한다. Gemini 3.8 Live는 네이티브 speech-to-speech 모델의 단계적 진화(step change)로, 대화 흐름을 유지하면서 복잡한 작업을 수행할 수 있다.
Gemini 3.8 Live의 핵심 기능
Gemini 3.8 Live Extended Thinking은 복잡한 요청에 대해 심층 추론을 제공하며, Artificial Analysis의 Speech-to-Speech 리더보드에서 1위를 기록했다. 주요 기능으로는 백그라운드 API 호출 중에도 오디오 스트리밍을 지속하는 Asynchronous function calling, 실시간 시각 입력 기반 대화, 그리고 97개 이상의 언어와 액센트를 지원하는 다국어 기능이 포함된다. 또한 확인 코드 파싱을 위한 Alphanumeric precision과 실시간 오디오와 구조화 데이터를 병합하는 Incremental content updates를 제공한다.
Gemini 3.5 Transcribe의 성능과 특징
전용 speech-to-text 모델인 Gemini 3.5 Transcribe는 85개 이상의 언어를 지원하며, 스트리밍 모드에서 평균 WER 4.0%, 비스트리밍 모드에서 **2.6%**의 높은 정확도를 달성했다. 문장 내 언어 전환을 자동 처리하는 Automatic code-switching과 최대 1,000개 용어를 보정하는 Custom vocabulary biasing 기능을 통해 콜센터 에이전트나 실시간 오디오 분석 등 저지연·고정밀 작업에 최적화되었다. Interactions API를 통해 최대 1시간 분량의 오디오 파일 전사와 화자 분리(speaker diarization)도 지원한다.
배포 인프라 및 가격
Gemini 3.8 Live의 audio input은 분당 $0.005, audio output은 분당 $0.018로 책정되었다. Agora, LiveKit, Vercel 등 주요 배포 인프라 파트너들과 연동된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.