IBM Granite 4.1 8B 공개
Granite 4.1: IBM's 8B Model Is Competing With Models Four Times Its Size
IBM이 Granite 4.1 3B·8B·30B를 공개하고, 8B가 32B급과 맞섰다.
IBM이 Granite 4.1 3B·8B·30B를 공개했다. 세 모델은 dense decoder-only 구조와 Apache 2.0 라이선스를 쓰며, 엔터프라이즈용으로 설계됐고 15조 토큰으로 학습됐다.
핵심은 8B다. 이전 세대 **Granite 4.0-H-Small(32B MoE, 9B active)**보다 훨씬 작지만, 여러 벤치마크에서 더 높은 점수를 냈다.
- ArenaHard 69.0
- BFCL V3 68.3
- GSM8K 92.5
- EvalPlus 80.2
3B도 IFEval 82.1, GSM8K 87.0, BFCL V3 60.8로 작지 않은 수치를 냈고, 30B는 BFCL V3 73.7, ArenaHard 71.0, GSM8K 94.2로 IBM 차트 최상위권에 올랐다.
학습 파이프라인은 단계적으로 다듬었다. 사전학습은 5단계로 진행됐고, 중간부터 code와 math 비중을 크게 늘렸다. SFT 전에는 LLM-as-Judge와 규칙 기반 필터로 저품질 응답을 걸러 4.1M 샘플만 남겼다. 이후 RL은 4단계로 돌렸고, 일반 채팅용 RLHF가 수학 성능을 깎자 별도 수학 RL로 복구했다.
긴 컨텍스트는 32K → 128K → 512K 순서로 확장했다. 8B와 30B는 최종적으로 512K까지 지원하고, 3B는 128K까지만 간다. RULER에서는 8B가 83.6→79.1→73.0, 30B가 85.2→84.6→76.7로 내려가며, 길어질수록 점수는 완만히 하락하지만 급락은 없다.
실행은 Ollama, vLLM, Transformers, IBM API를 지원하고 FP8 양자화도 제공한다. 다만 비교 수치는 IBM 자체 평가 하네스 기준이라 교차 검증이 필요하다. 그럼에도 작은 dense 모델이 더 큰 MoE 모델을 여러 작업에서 앞선 사례로는 충분히 주목할 만하다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.