Desert Ant Labs, 디바이스 내 실행되는 초고속·소형 AI 모델 18종 공개
·2026.09.08 09:00
핵심 내용
유럽 기반 Desert Ant Labs가 클라우드 의존 없이 디바이스에서 실행되는 오디오, 비전 등 특화 소형 모델 18종을 공개했다.
1 / 2
자세히 보기
유럽 기반 AI 연구소 Desert Ant Labs가 클라우드 API 의존도를 낮추고 디바이스 내에서 직접 실행되는 소형 특화 모델 18종(Stable 12, Beta 6)을 공개했다. 이 모델들은 오디오, 비전, 텍스트 처리에 최적화되어 있으며, 월간 활성 디바이스 10만 대까지 무료로 제공된다.
주요 모델 성능 및 특징
각 모델은 특정 태스크에 집중하여 기존 클라우드 모델 대비 압도적인 속도와 효율성을 제공한다.
- Voz (오디오 전사): iPhone에서 10분 분량의 오디오를 2초 만에 처리하며, Whisper 대비 4.7배 빠르다. M3 Ultra 기준 실시간 배율은 319x로 Apple SpeechAnalyzer(78x)와 Whisper large-v3-turbo(50x)를 크게 앞선다.
- Clear (오디오 품질 향상): 9MB의 경량 모델로 5분 랩톱 녹음을 1초 만에 스튜디오 품질로 변환한다. MacBook Pro(M5) 기준 실시간 배율은 345x에 달한다.
- Redact (개인정보 마스킹): 27개 언어에서 이름, 주소, 카드 번호 등을 실시간으로 마스킹한다. 12MB 모델로 개인 데이터 검출 정확도 **88.8%**를 기록해, 더 큰 규모의 GLiNER-PII(91.1%)와 경쟁 가능한 성능을 보인다.
- Tongue (언어 식별): 2MB 모델로 3단어만으로 84개 언어를 식별하며 정확도는 0.933이다.
- Clips (영상 클리핑): 10분 영상을 5초 만에 12개 클립으로 생성한다. Claude Sonnet 대비 10배 빠르고 에너지 사용량은 470배 적다.
전략 및 배포
Desert Ant Labs는 기존 클라우드 서비스의 인프라 비용 증가와 지연 문제를 해결하기 위해 '소뇌(cerebellum)' 개념의 상시 실행형 전문 모델을 우선 개발했다. 향후에는 소형 로컬 모델부터 대형 클라우드 모델까지 계층적으로 라우팅하는 '피질(cortex)' 구조를 도입할 계획이다.
개발자들은 Swift, Kotlin, JavaScript용 단일 SDK를 통해 이 모델들을 통합할 수 있으며, Mac용 CLI와 Hugging Face를 통해 체험 가능하다. 또한, 자체 비디오 편집 앱인 Detail 6는 iOS 27과 함께 출시되며 모든 클라우드 API를 자체 온디바이스 모델로 대체할 예정이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.