Cortexist, 경량 결정 헤드 적용한 Gemma 4 음성 스택 출시
LLM or JEV? Why not both? - introducing a hybrid Gemma4 approach
핵심 내용
Cortexist가 Gemma 4 기반 하이브리드 음성 스택을 공개해 로컬 벤치마크에서 최대 99.0%의 시작 턴 정확도를 달성했다.
자세히 보기
Cortexist가 Gemma 4 기반의 하이브리드 음성 스택을 공개했다. 언어 생성에는 Gemma 4를, 화자 전환(turn-taking) 판단에는 JEV에서 영감을 받은 경량 결정 헤드를 결합한 방식이다. 별도 모델이나 태그 토큰 대신, 동결된 Gemma 4 백본(E4B 및 12B 변형)에 연결된 세 개의 초소형 MLP가 기존 prefill 패스의 마지막 프롬프트 토큰 정규화된 숨겨진 상태를 읽어 speak, defer, wait 세 가지 행동을 점수화한다.
성능 벤치마크
v0.5 화자 전환 세트에서 로컬 헤드는 제로샷 JEV 1.13.0 호출과 동일한 레이블로 학습된 Laya 파일럿 모델보다 우수한 성능을 보였다.
- Gemma 4 E4B + 헤드: 시작 턴 정확도 95.8%, 중단 정확도 85.8%.
- Gemma 4 12B + 헤드: 시작 턴 정확도 99.0%, 중단 정확도 72.6%.
- JEV 1.13.0: 시작 턴 정확도 65.6%, 중단 정확도 69.8%.
- Laya: 정확도 30%대.
소규모 개발 세트에서 Gemma 4 자체 텍스트 경로와 비교했을 때, E4B 헤드는 시작 턴 정확도 **90.7%**로 텍스트 전용 경로의 **67.4%**를 앞섰고, 중단 정확도는 **76.5%**로 텍스트 전용의 **52.9%**보다 높았다. 이는 태그 생성에 필요한 연산 비용의 일부로 달성된 결과다.
한계 및 범위
숨겨진 상태가 확보되면 결정 헤드는 CPU에서 1밀리초 미만으로 실행되어 오버헤드가 거의 없다. 다만 현재 구현은 다중 화자 음성 장면에 특화되어 있다. 실제 대화 정확도는 **78~85%**로 떨어지며, 학습 레이블은 합성 데이터다. 현재 시스템은 비권위(non-authority) 턴을 과도하게 우선시하는 경향이 있어, 권위 우선 지표에서는 JEV가 93.4%로 70.8~81.1%인 본 시스템보다 앞서 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.