Cactus Compute, 16.9MB 초경량 온디바이스 음성 인식 모델 Whistle 공개
핵심 내용
Cactus Compute가 16.9MB 온디바이스 음성 인식 모델 Whistle을 공개했다.
자세히 보기
Cactus Compute가 모바일, 웨어러블, 로봇, 마이크로컨트롤러용 오픈 소스 음성 인식 모델 Whistle을 공개했다. 이 모델은 16.9 MB 단일 파일로 CPU에서 의존성 없이 실행되며, 기존 모델 Needle과 동일한 C++ 엔진과 양자화 기술을 공유한다.
핵심 기능 및 아키텍처
Whistle은 디바이스에서 전사, 단어 타임스탬핑, 음성 임베딩의 세 가지 주요 기능을 수행한다. 7개 언어(영어, 독일어, 프랑스어, 스페인어, 이탈리아어, 네덜란드어, 폴란드어)를 지원하며 자동 언어 감지 기능을 제공한다. 아키텍처는 8개의 Simple Attention 블록을 갖춘 비인과적 인코더와 8개의 Laddered Simple Attention 블록을 갖춘 디코더를 활용한다. 각 디코더 계층의 gated cross attention은 클립당 인코더 출력을 한 번만 읽도록 하여, 5-빔 검색 시 오디오를 각 빔마다 재인코딩하지 않고 동일한 오디오 처리를 공유할 수 있게 한다.
성능 벤치마크
Apple M4 Pro CPU에서 Whistle은 Whisper base 및 Moonshine tiny v2 대비 상당한 속도 우위를 보인다.
- 첫 토큰 생성 시간: 11.1 ms (Whisper base 73.2 ms, Moonshine tiny v2 22.8 ms 대비)
- 디코딩 속도: 초당 1,319 토큰 (Whisper base 266/s, Moonshine tiny v2 262/s 대비)
- 모델 크기: 16.9 MB (Whisper base 145.3 MB, Moonshine tiny v2 41.9 MB 대비)
Whistle은 LibriSpeech, SPGISpeech, Earnings-22, FLEURS 평균에서 Whisper base보다 낮은 단어 오류율을 기록한다. 반면 TED-LIUM, AMI, MLS 평균에서는 Whisper base가 더 나은 성능을 보인다.
통합 및 배포
Whistle은 Needle 엔진과 직접 통합되어 단일 바이너리로 음성 및 텍스트 작업을 처리할 수 있다. needle_complete 함수는 오디오 클립을 받아 전사하고 도구 호출을 한 단계로 실행하며, 전사 내용과 함수 호출이 포함된 JSON 객체를 반환한다. 모델은 pip install cactus-needle로 설치할 수 있으며, macOS, Linux, Android, iOS, watchOS, Windows on ARM, RISC-V, MIPS, 브라우저 등 17개 타겟용 사전 빌드 바이너리를 지원한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.