AI Briefing

툴콜링 강화 8B

ibm-granite/granite-4.1-8b · Hugging Face

·2026.04.22 05:59

핵심 내용

IBM이 Granite-4.1-8B를 공개, 도구 호출과 지시 따르기 성능을 강화했다.

자세히 보기

IBM Granite Team이 Granite-4.1-8B를 공개했다. 이 모델은 8B 파라미터 장문 컨텍스트 instruct 모델로, Granite-4.1-8B-Base를 바탕으로 SFT와 강화학습(RL) 정렬을 거쳐 tool calling, instruction following, chat 성능을 끌어올렸다.

주요 정보:

  • 라이선스: Apache 2.0
  • 지원 언어: 영어, 독일어, 스페인어, 프랑스어, 일본어, 포르투갈어, 아랍어, 체코어, 이탈리아어, 한국어, 네덜란드어, 중국어
  • 주요 용도: 범용 AI assistant, 비즈니스 애플리케이션, tool-use agent
  • 핵심 기능: 요약, 분류, 추출, QA, RAG, 코드 작업, 함수 호출, 다국어 대화, FIM 코드 완성

벤치마크에서는 8B 모델 기준으로 MMLU 73.84, MMLU-Pro 55.99, BBH 80.51, IFEval 85.87, ArenaHard 68.98, HumanEval 85.37, BFCL v3 68.27를 제시했다. 다국어 항목에서는 MMMLU 64.84, INCLUDE 58.89, MGSM 82.32를 기록했다.

아키텍처는 decoder-only dense transformer이며, GQA, RoPE, SwiGLU, RMSNorm, shared embeddings를 사용한다. 시퀀스 길이는 4096이다.

IBM은 이 모델을 CoreWeave의 NVIDIA GB200 NVL72 클러스터에서 학습했다고 밝혔고, 공식 문서와 GitHub 저장소도 함께 제공했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.