Muse-Glimmer-30B: SWE-bench 76% 기록한 30B 멀티모달 모델
meta-models/Muse-Glimmer-30B
프로젝트 소개
Muse Glimmer-30B는 텍스트와 이미지, 영상을 동시에 이해하는 30B 파라미터 규모의 멀티모달 언어 모델이다. 텍스트 입력뿐 아니라 이미지 패치와 영상 토큰을 처리할 수 있어, 시각 정보와 텍스트 지시가 섞인 복합적인 작업을 단일 모델로 수행한다. Transformers 라이브러리를 기반으로 하며, Hugging Face 생태계에서 바로 추론이 가능하다.
이 모델의 핵심 강점은 구조화된 도구 호출과 추론 과정의 분리 처리다. ATEM(Advanced Tool-calling Environment Model) 프로토콜을 통해 도구 호출을 별도의 채널로 분리하고, 내부 추론(reasoning)을 'to=self' 채널로 독립적으로 기록한다. 이는 도구 호출 시 인자 검증이 엄격하게 이루어지도록 하며, 복잡한 작업 흐름에서 오류를 줄이는 데 기여한다. SWE-bench Verified에서 76%, SWE-bench Pro에서 51.2%의 점수를 기록해 코드 수정 능력도 입증했다.
기존의 단일 채널 도구 호출 방식과 달리, 수신자(recipient)를 명시적으로 구분하는 구조를 채택했다. 시스템, 사용자, 도구, 어시스턴트 간 메시지 흐름이 명확히 분리되어, 멀티턴 대화와 도구 연동이 혼재된 환경에서도 컨텍스트를 유지하기 쉽다. GPQA Diamond 벤치마크에서 83.5%, AIME 2026에서 94.7%의 점수를 보이며, 고난도 추론과 수학 문제 해결에도 강점을 보인다.
Together AI와 Fireworks AI에서 실시간 추론이 지원되며, 특히 Together AI에서는 초당 96.7 토큰의 처리 속도와 구조화된 출력, 도구 호출 기능이 활성화되어 있다. 코드 자동 수정, 멀티모달 문서 분석, 복잡한 도구 연동이 필요한 에이전트 개발에 적합하다. 30B 규모로 온프레미스 배포가 가능하며, 43만 회 이상의 다운로드를 기록해 커뮤니티 검증이 이루어진 모델이다.
meta-models/Muse-Glimmer-30B
원문에 등록된 설명이 없습니다.
image-text-to-text
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.