AI Briefing

Cactus Compute, 16.9MB Whistle ASR 모델 출시

Whistle: speech to text in a 16.9MB file

·2026.10.06 02:27

핵심 내용

Cactus Compute가 16.9MB 초소형 ASR 모델 Whistle을 공개했다.

자세히 보기

Cactus Compute가 스마트워치, 스마트 홈 기기, 마이크로컨트롤러 등 초소형 디바이스용 자동 음성 인식(ASR) 모델 Whistle을 공개했다. 이 모델의 크기는 16.9MB로, Whisper base 대비 파일 용량을 9배 줄였으며 추론 속도는 6배 더 빠르다.

성능 지표

Whistle은 55M 파라미터(활성 36M) 모델로 CQ2bit 양자화를 적용했다. 주요 벤치마크에서 Whisper base와 경쟁력 있는 정확도를 보인다:

  • LibriSpeech test-clean: 4.31 WER (Whisper base: 4.9)
  • LibriSpeech test-other: 10.49 WER (Whisper base: 11.0)
  • FLEURS 평균: 21.4 (Whisper base: 24.5)
  • SPGISpeech: 7.65
  • Earnings-22: 19.01

아키텍처 및 기능

이 모델은 로그-멜 프런트엔드와 컨볼루션 스템을 오디오 인코더로 연결하며, 게이트 크로스 어텐션을 사용하는 Simple Attention + Hadamard MLP 디코더를 결합했다. 주요 기능은 다음과 같다:

  • Laddered Decoder: Needle과 유사하게 2레이어부터 원하는 깊이로 배포할 수 있어 유연한 리소스 관리가 가능하다.
  • Keyword Biasing: 빔 서치 중 특정 이름의 인식률을 높인다.
  • Word Timestamps: 디코더 어텐션을 통해 생성되어 정밀한 탐색 및 하이라팅을 지원한다.

플랫폼 지원

Whistle은 macOS, Linux(x86-64, ARM64, ARMv7, RISC-V, MIPS32), Windows(x64, ARM), Android, iOS, watchOS, tvOS, 그리고 WebAssembly와 WASI 컴포넌트를 통한 브라우저 환경까지 17개 플랫폼을 지원한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.