IBM 8B 모델, 4배 큰 모델들과 경쟁
Granite 4.1: IBM's 8B Model Is Competing With Models Four Times Its Size
핵심 내용
IBM이 Granite 4.1을 공개하고 8B 모델이 4배 큰 모델들과 경쟁했다.
자세히 보기
IBM이 Granite 4.1 패밀리를 공개했다. 3B·8B·30B 세 가지 크기의 dense decoder-only transformer로, 같은 파이프라인과 데이터 전략을 공유하며 학습 규모는 15조 토큰, 라이선스는 Apache 2.0다.
- 8B는 이전 세대 Granite 4.0-H-Small(32B MoE, 9B active) 보다 여러 벤치마크에서 앞섰다.
- 핵심 수치는 ArenaHard 69.0, BFCL V3 68.3, GSM8K 92.5, EvalPlus 80.2다.
- IFEval에서는 Gemma가 94.1로 앞섰지만, 8B는 87.1로 Qwen3.5-9B(87.2)와 사실상 비슷했다.
- 30B는 BFCL V3 73.7로 Gemma-4-31B(72.7)를 앞섰고, 3B도 **Qwen3-8B(60.2)**를 넘어섰다.
학습은 5단계로 진행됐다. 초반에는 **CommonCrawl 59% / code 20% / math 7%**로 시작했고, 중간 단계에서 math와 code 비중을 키운 뒤 후반에는 chain-of-thought trajectories, instruction data, 고품질 웹 데이터를 섞었다. 미세조정 전에는 LLM-as-Judge와 규칙 기반 필터로 hallucination, false premise, incorrect computation을 걸러 4.1M개 샘플만 남겼다.
강화학습은 4단계였다. 9개 도메인을 묶은 공동 RL로 망각을 줄이고, RLHF로 chat 품질을 끌어올렸지만 수학 점수가 하락했다. 이후 identity/knowledge calibration과 수학 전용 RL로 GSM8K와 DeepMind-Math를 회복했다. 긴 컨텍스트는 32K → 128K → 512K 순으로 확장했고, 마지막 단계에서는 **books 80% + code repo 20%**를 사용했다. RULER에서는 8B가 83.6 / 79.1 / 73.0, 30B가 85.2 / 84.6 / 76.7을 기록했으며 3B는 128K까지만 지원한다.
Ollama, vLLM, Transformers, IBM API로 실행할 수 있고, FP8 양자화 버전도 제공된다. 도구 호출, 예측 가능한 지연 시간, 상용 라이선스가 필요한 배포에 맞으며 8B가 가장 균형이 좋다. 3B는 엣지/저비용 추론용, 30B는 상한선이다. 다만 비교 수치는 IBM 자체 평가 하네스 기준의 자가 보고 결과다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.