추천JetBrains의 Mellum 2
JetBrains가 소프트웨어 엔지니어링에 특화된 12B 파라미터 MoE 모델 **Mellum 2**를 공개했다.
Mellum 2는 소프트웨어 엔지니어링 작업에 특화된 12B 파라미터 규모의 Mixture-of-Experts (MoE) 언어 모델이다. 코드 생성 및 편집, 디버깅, 멀티스텝 추론, 도구 사용 및 에이전트 코딩 등 다양한 프로그래밍 보조 기능을 수행하며, 기존 4B 밀집(dense) 모델의 후속작이다.
모델 아키텍처는 64개의 전문가 중 8개를 활성화하는 MoE 구조를 채택했다. Grouped-Query Attention(4 KV heads)과 4개 레이어 중 3개에 적용되는 Sliding Window Attention을 결합했으며, Multi-Token Prediction 헤드를 통해 보조 학습 목표 달성과 동시에 추론 효율을 높이는 Speculative Decoding용 드래프트 모델 역할을 수행한다.
약 10.6조 개의 토큰을 활용한 3단계 커리큘럼 학습을 거쳤다. 웹 데이터에서 시작해 정제된 코드와 수학 콘텐츠로 점진적으로 전환하며, Muon 최적화와 FP8 하이브리드 정밀도를 사용했다. 또한 YaRN 기술을 통해 128K의 컨텍스트 창을 확보했다.
출시된 모델은 직접 답변하는 Instruct 모델과 명시적인 추론 과정을 거치는 Thinking 모델 두 가지 버전이다. Mellum 2는 4B~14B 규모의 오픈 웨이트 모델들과 경쟁 가능한 성능을 보이면서도, 실제 연산량은 2.5B 밀집 모델 수준으로 유지하여 높은 효율성을 자랑한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.