Apple, 라텐트 공간 증류로 오디오 인코더 2.8배 압축 성공
·2026.09.24 09:00
핵심 내용
Apple이 라텐트 공간 증류로 오디오 인코더를 2.8배 압축했으며, WER 오차는 1.9% 이내로 유지했다.
자세히 보기
Apple 연구진이 온디바이스 음성 인식을 위해 스트리밍 신경 오디오 인코더를 압축하는 라텐트 공간 증류(latent-space distillation) 기법을 개발했다. 이 방식은 이산 토큰이나 출력 분포가 아닌, 토크나이저와 언어 모델 간 마지막 공유 인터페이스인 양자화기 이전의 라텐트 표현을 타깃으로 한다.
증류 방법론
이 기법은 제곱 오차 목적 함수를 사용해 학생 인코더가 교사의 프레임별 라텐트를 회귀하도록 학습한다. 교사와 학생 모델 간 너비 불일치는 단일 아핀 레이어로 흡수한다. 타깃이 양자화기와 언어 모델 브리지 이전에 위치하므로, 이 단일 레시피는 지원되는 모든 토큰 인터페이스에 적용되며 단독 또는 언어 모델과 함께 학습된 토크나이저 모두에 작동한다.
성능 결과
2.8배 압축 시, 증류된 학생 모델은 미세 조정 없이 6개 교사-학생 쌍 중 5개에서 상대 WER 1.9% 이내로 교사와 유사한 성능을 유지한다. 또한 동일 용량의 독립 학습 토크나이저 대비 상대적으로 3.9% 개선된 성능을 보인다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.