AI Briefing

Wispr, 실시간 전사 특화 음성 모델 'Canto' 공개... GRPO 학습으로 경쟁 모델 대비 낮은 WER 달성

·2026.09.18 03:32

핵심 내용

Wispr Advanced Interfaces Lab이 GRPO 강화 학습을 적용해 실시간 전사 환경에서 낮은 단어 오류율(WER)을 달성한 음성 모델 'Canto'를 공개했다.

1 / 9

자세히 보기

Wispr Advanced Interfaces Lab이 실시간 전사(dictation)를 위해 설계된 새로운 음성 모델 'Canto'를 공개했다. 이 모델은 수백만 시간의 음성 데이터로 사전 학습된 후, Supervised Fine-Tuning(SFT)과 Reinforcement Learning(RL)을 결합한 방식으로 학습되었다.

성능 및 평가

실제 전사 데이터와 노이즈, 속삭임, 원거리 발화 등 도전적인 환경을 포함한 벤치마크에서 Canto는 Google, OpenAI, AssemblyAI, Deepgram 등 경쟁 모델 대비 가장 낮은 Word Error Rate(WER)를 기록했다. 전체 도전 세트에서는 대형 멀티모달 모델인 Gemini 3.1 Pro가 1위를 차지했으나, Gemini 3.1 Pro는 실시간 저지연 애플리케이션에 적합하지 않다. 실시간 전사 모델들 중에서는 Canto가 가장 낮은 WER를 달성했다. 특히 저음량 발화와 짧은 전사 문장에서 Canto는 최저 오류율과 동률을 기록했다.

GRPO 기반 학습 전략

Canto는 Group Relative Policy Optimization(GRPO)을 활용하여 학습 효율을 높였다. 동일한 오디오 입력에 대해 여러 개의 전사본 후보(rollouts)를 생성하고, 참조 데이터와의 비교를 통해 보상(reward)을 계산한 뒤 상대적 advantage를 기반으로 모델을 업데이트한다. 이를 통해 어려운 녹음 조건에서의 인식 오류를 줄이고, 완성된 전사본의 품질을 평가하는 RL 방식을 통해 특정 실패 모드에 대한 학습 환경을 구축할 수 있다.

향후 계획

Wispr는 Canto를 첫 단계로 삼아 차세대 모델을 개발 중이며, 컨텍스트 신뢰도, 개인화, 화자 분리(diarization) 등 오픈 리서치 문제를 해결하기 위한 인프라를 활용하고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.