AI Briefing

Cactus Compute, 29MB급 초소형 모델 'Needle 3' 공개… DeepSeek V4 Flash급 성능 주장

·2026.09.18 09:11

핵심 내용

Cactus Compute가 29MB~121MB 크기의 초소형 파운데이션 모델 'Needle 3'를 공개했으며, 4레이어 서브네트워크가 DeepSeek V4 Flash와 동등한 자동화 성능을 달성했다고 밝혔다.

자세히 보기

Cactus Compute가 엣지 디바이스 및 온디바이스 AI를 타겟으로 하는 초소형 파운데이션 모델 **'Needle 3'**를 공개했다.

핵심 아키텍처 및 성능

  • Intelligence Laddering: 하나의 모델 내에서 2레이어(2L)부터 20레이어(20L)까지 용량이 증가하는 서브네트워크 구조를 채택했다.
  • 크기 및 효율: 총 121M 파라미터 규모이며, CQ2 양자화 적용 시 29MB~121MB 크기로 배포 가능하다. 토큰당 MFLOPs 효율이 높다.
  • 성능 주장: 4레이어 서브네트워크(29M 파라미터)가 파인튜닝 시 DeepSeek V4 Flash의 클라우드 API 성능을 넘어서거나 동등한 수준을 달성했다. 특히 모바일 툴 호출(Mobile Actions)에서는 10배 큰 모델을 능가하고, 추출(Extraction) 작업에서는 2~3배 큰 모델과 유사한 성능을 보인다.
  • 속도: Raspberry Pi 등에서 실행 가능하며, 경량화된 구조를 통해 높은 추론 속도를 제공한다.

파인튜닝 및 배포

  • 파인튜닝: 동결된 베이스 모델(20레이어)에 LoRA를 적용한 후, 특정 레이어 수의 서브네트워크를 4-bit .cact 파일로 빌드하여 배포한다. DroidCall 데이터셋으로 파인튜닝 시 모든 서브네트워크의 성능이 18~36점 상승했다.
  • 지원 플랫폼: macOS, Linux, Windows, Android, iOS, tvOS, watchOS, 브라우저(WASM) 등 다양한 플랫폼을 지원한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.