needle: RAM 28MB로 도구를 부르는 45M LLM
cactus-compute/needle
프로젝트 소개
Needle 2는 Cactus Compute가 개발한 45M 파라미터 소형 언어 모델이다. 전체 모델이 14MB 크기의 단일 바이너리로 제공되며, 추론 시 RAM 28MB만 사용한다. CQ2-bit 양자화 기술과 자체 엔진을 적용해 네트워크 연결 없이도 온디바이스 환경에서 동작한다.

핵심 기능은 도구 호출, 기기 제어, 구조화된 데이터 추출이다. Python 함수를 도구로 등록하면 모델이 해당 함수를 선택하고 인자를 채워 실행하며, 결과는 JSON 형식으로 반환된다. Pydantic 모델을 지정하면 텍스트에서 필요한 필드만 추출해 타입이 보장된 객체를 돌려준다.
기존 소형 모델들과의 차별점은 메모리 효율과 신뢰성 제어에 있다. 256토큰 슬라이딩 윈도우와 KV sink 기술을 적용해 대화 길이에 관계없이 메모리 사용량이 28MB 수준으로 유지된다. 또한 학습된 헤드를 통해 응답마다 신뢰도 점수를 부여하며, 설정한 임계값 미만이면 에스컬레이션하도록 설계되어 있다.
LoRA 파인튜닝을 지원해 특정 도구나 도메인에 맞춰 모델을 최적화할 수 있다. JAX 기반 학습으로 NVIDIA GPU와 Apple Silicon 모두에서 훈련이 가능하며, 튜닝된 모델은 단일 .cact 파일로 내보내져 동일한 엔진에서 바로 실행된다. 스마트폰, 웨어러블, 스마트홈, 로봇 등 리소스가 제한된 엣지 디바이스에 LLM 기능을 탑재하려는 개발자에게 적합하다.
cactus-compute/needle
Automation foundation model for tiny devices: 2-bit, 8-29 MB, tool calls, structured extraction and embeddings on phones, wearables, smart homes, robots, cars and microcontrollers.
Python
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

