AI Briefing

오픈소스 추론 모델 Jamba Reasoning 3B 공개

·2025.10.08 18:09

AI21이 3B급 온디바이스 오픈소스 추론 모델 Jamba Reasoning 3B를 공개했다.

AI21 Labs가 Jamba Reasoning 3B를 공개했다. 3B 파라미터의 오픈소스 추론 모델로, SSM-Transformer 하이브리드 아키텍처와 256K 토큰 컨텍스트 윈도우를 갖고 최대 1M 토큰까지 처리할 수 있다.

회사는 DeepSeek, Google, Llama, Microsoft 대비 2~5배 효율을 내세우며, Apache 2.0 라이선스로 배포한다. 경량 메모리 구조 덕분에 iPhone, Android, Mac, PC에서 온디바이스로 실행할 수 있다고 설명한다.

핵심 성능 포인트는 다음과 같다.

  • KV cache를 일반 Transformer보다 8배 작게 유지해 긴 컨텍스트에서도 메모리 사용량을 낮춘다.
  • M3 MacBook Pro에서 32K 토큰 컨텍스트 기준 초당 40토큰을 처리한다.
  • IFBench, MMLU-Pro, Humanity's Last Exam에서 온디바이스 모델들보다 우수한 성능을 주장한다.
  • 후처리에는 RLVR, SFT, DPO, GRPO와 자체 기법을 결합했다.

AI21 Labs는 이 모델을 법률·의료 문서의 로컬 엔티티 추출, 현장 기술자의 매뉴얼 접근, 개인화된 파일 DB 기반의 대화·작성 보조기, 온디바이스 RAG 용도에 맞춘다. 기사 후반부에서는 **40~70%**의 AI 작업을 10~30배 낮은 비용으로 처리할 수 있는 SLM 라우팅이 비용, 지연, 프라이버시 측면에서 유리하다고 강조한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.