AI Briefing

AMD, Instella-MoE 공개

Instella-MoE: AMD Instinct GPU에서 처음부터 학습한 완전 오픈 16B MoE 모델

·2026.08.05 06:30

AMD가 ROCm 기반으로 학습한 완전 오픈 16B MoE 모델을 공개했다.

AMD가 전체 16B 파라미터, 토큰당 활성 2.8B 파라미터 규모의 희소 활성 MoE 언어 모델 Instella-MoE를 공개했다. 모델은 AMD Instinct MI300X·MI325X GPU와 ROCm 소프트웨어 스택만으로 처음부터 학습됐다.

Instella-MoE는 가중치뿐 아니라 다음 학습 자산을 함께 공개하는 완전 오픈 모델을 지향한다.

  • 학습 코드와 설정
  • 데이터 배합과 단계별 학습 레시피
  • 사전학습 및 사후학습 체크포인트
  • 중간 체크포인트와 모델 설정 파일

학습에는 AMD의 오픈소스 프레임워크 Primus, 강화학습 기반 사후 학습에는 Miles를 사용했다. 아키텍처에는 Gated MLAFarSkip-Collective가 적용됐다.

전체 학습 파이프라인은 1차·2차 사전학습, 미드트레이닝, 롱컨텍스트 확장, 지도 미세조정, 강화학습으로 이어지는 6단계이며, 사전학습에는 총 7.1T 토큰이 사용됐다. 단계별 체크포인트를 통해 미드트레이닝과 사후학습이 모델 능력에 미친 영향도 재현·분석할 수 있다.

공개 자료의 비교 결과에서 Instella-MoE는 활성 파라미터가 2배 이상 많은 OLMo-3-7B보다 높은 성능 대역을 2.8B 활성 파라미터로 달성한 것으로 제시됐다. 완전 오픈 모델 생태계에 MoE와 AMD GPU 기반 학습 사례를 함께 추가했다는 점이 핵심이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.