AI Briefing

IBM 8B 모델, 4배 큰 모델들과 경쟁

Granite 4.1: IBM's 8B Model Is Competing With Models Four Times Its Size

·2026.04.30 21:14

IBM이 Granite 4.1을 공개하고 8B 모델이 4배 큰 모델들과 경쟁했다.

IBM이 Granite 4.1 패밀리를 공개했다. 3B·8B·30B 세 가지 크기의 dense decoder-only transformer로, 같은 파이프라인과 데이터 전략을 공유하며 학습 규모는 15조 토큰, 라이선스는 Apache 2.0다.

  • 8B는 이전 세대 Granite 4.0-H-Small(32B MoE, 9B active) 보다 여러 벤치마크에서 앞섰다.
  • 핵심 수치는 ArenaHard 69.0, BFCL V3 68.3, GSM8K 92.5, EvalPlus 80.2다.
  • IFEval에서는 Gemma가 94.1로 앞섰지만, 8B는 87.1로 Qwen3.5-9B(87.2)와 사실상 비슷했다.
  • 30BBFCL V3 73.7로 Gemma-4-31B(72.7)를 앞섰고, 3B도 **Qwen3-8B(60.2)**를 넘어섰다.

학습은 5단계로 진행됐다. 초반에는 **CommonCrawl 59% / code 20% / math 7%**로 시작했고, 중간 단계에서 math와 code 비중을 키운 뒤 후반에는 chain-of-thought trajectories, instruction data, 고품질 웹 데이터를 섞었다. 미세조정 전에는 LLM-as-Judge와 규칙 기반 필터로 hallucination, false premise, incorrect computation을 걸러 4.1M개 샘플만 남겼다.

강화학습은 4단계였다. 9개 도메인을 묶은 공동 RL로 망각을 줄이고, RLHF로 chat 품질을 끌어올렸지만 수학 점수가 하락했다. 이후 identity/knowledge calibration과 수학 전용 RL로 GSM8KDeepMind-Math를 회복했다. 긴 컨텍스트는 32K → 128K → 512K 순으로 확장했고, 마지막 단계에서는 **books 80% + code repo 20%**를 사용했다. RULER에서는 8B가 83.6 / 79.1 / 73.0, 30B가 85.2 / 84.6 / 76.7을 기록했으며 3B는 128K까지만 지원한다.

Ollama, vLLM, Transformers, IBM API로 실행할 수 있고, FP8 양자화 버전도 제공된다. 도구 호출, 예측 가능한 지연 시간, 상용 라이선스가 필요한 배포에 맞으며 8B가 가장 균형이 좋다. 3B는 엣지/저비용 추론용, 30B는 상한선이다. 다만 비교 수치는 IBM 자체 평가 하네스 기준의 자가 보고 결과다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.