AI Briefing

Cactus Needle (GitHub 저장소)

·2026.05.13 09:00

Gemini 3.1을 증류해 만든 26M 파라미터 규모의 초경량 AI 모델 Needle이 공개되었다.

Cactus Compute는 Gemini 3.1을 증류하여 단 26M 파라미터 규모의 Simple Attention NetworkNeedle을 개발했다. 이 모델은 Mac이나 PC에서도 로컬 파인튜닝이 가능하며, Cactus 환경에서 구동 시 초당 6,000 토큰의 프리필(prefill)과 1,200 토큰의 디코드(decode) 속도를 구현한다.

Needle은 스마트폰, 워치, 안경 등 소비자용 기기를 위한 Tiny AI를 목표로 설계되었다. 단일 샷 Function Call 성능 면에서는 FunctionGemma-270m, Qwen-0.6B 등의 모델을 능가하지만, 대화형 작업보다는 개인용 AI 에이전트의 도구 호출에 최적화되어 있다.

주요 기술적 특징은 다음과 같다.

  • 16개의 TPU v6e를 사용하여 200B 토큰으로 사전 학습(Pre-training)을 진행했다.
  • 2B 토큰 규모의 단일 샷 함수 호출 데이터셋으로 사후 학습(Post-training)을 완료했다.
  • 가중치(Weights)와 데이터 생성 방식은 Hugging Face를 통해 완전히 공개되어 있다.

사용자는 제공되는 Playground UI를 통해 자신의 도구에 맞춰 모델을 테스트하고, 클릭 한 번으로 간편하게 파인튜닝할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.