Cactus Compute, 29MB급 초소형 모델 'Needle 3' 공개… DeepSeek V4 Flash급 성능 주장
·2026.09.18 09:11
핵심 내용
Cactus Compute가 29MB~121MB 크기의 초소형 파운데이션 모델 'Needle 3'를 공개했으며, 4레이어 서브네트워크가 DeepSeek V4 Flash와 동등한 자동화 성능을 달성했다고 밝혔다.
자세히 보기
Cactus Compute가 엣지 디바이스 및 온디바이스 AI를 타겟으로 하는 초소형 파운데이션 모델 **'Needle 3'**를 공개했다.
핵심 아키텍처 및 성능
- Intelligence Laddering: 하나의 모델 내에서 2레이어(2L)부터 20레이어(20L)까지 용량이 증가하는 서브네트워크 구조를 채택했다.
- 크기 및 효율: 총 121M 파라미터 규모이며, CQ2 양자화 적용 시 29MB~121MB 크기로 배포 가능하다. 토큰당 MFLOPs 효율이 높다.
- 성능 주장: 4레이어 서브네트워크(29M 파라미터)가 파인튜닝 시 DeepSeek V4 Flash의 클라우드 API 성능을 넘어서거나 동등한 수준을 달성했다. 특히 모바일 툴 호출(Mobile Actions)에서는 10배 큰 모델을 능가하고, 추출(Extraction) 작업에서는 2~3배 큰 모델과 유사한 성능을 보인다.
- 속도: Raspberry Pi 등에서 실행 가능하며, 경량화된 구조를 통해 높은 추론 속도를 제공한다.
파인튜닝 및 배포
- 파인튜닝: 동결된 베이스 모델(20레이어)에 LoRA를 적용한 후, 특정 레이어 수의 서브네트워크를 4-bit
.cact파일로 빌드하여 배포한다. DroidCall 데이터셋으로 파인튜닝 시 모든 서브네트워크의 성능이 18~36점 상승했다. - 지원 플랫폼: macOS, Linux, Windows, Android, iOS, tvOS, watchOS, 브라우저(WASM) 등 다양한 플랫폼을 지원한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.