AI Briefing

AMD, Instella-MoE 공개

Instella-MoE: AMD Instinct GPU에서 처음부터 학습한 완전 오픈 16B MoE 모델

·2026.08.05 06:30

핵심 내용

AMD가 ROCm 기반으로 학습한 완전 오픈 16B MoE 모델을 공개했다.

1 / 2

자세히 보기

AMD가 전체 16B 파라미터, 토큰당 활성 2.8B 파라미터 규모의 희소 활성 MoE 언어 모델 Instella-MoE를 공개했다. 모델은 AMD Instinct MI300X·MI325X GPU와 ROCm 소프트웨어 스택만으로 처음부터 학습됐다.

Instella-MoE는 가중치뿐 아니라 다음 학습 자산을 함께 공개하는 완전 오픈 모델을 지향한다.

  • 학습 코드와 설정
  • 데이터 배합과 단계별 학습 레시피
  • 사전학습 및 사후학습 체크포인트
  • 중간 체크포인트와 모델 설정 파일

학습에는 AMD의 오픈소스 프레임워크 Primus, 강화학습 기반 사후 학습에는 Miles를 사용했다. 아키텍처에는 Gated MLA와 FarSkip-Collective가 적용됐다.

전체 학습 파이프라인은 1차·2차 사전학습, 미드트레이닝, 롱컨텍스트 확장, 지도 미세조정, 강화학습으로 이어지는 6단계이며, 사전학습에는 총 7.1T 토큰이 사용됐다. 단계별 체크포인트를 통해 미드트레이닝과 사후학습이 모델 능력에 미친 영향도 재현·분석할 수 있다.

공개 자료의 비교 결과에서 Instella-MoE는 활성 파라미터가 2배 이상 많은 OLMo-3-7B보다 높은 성능 대역을 2.8B 활성 파라미터로 달성한 것으로 제시됐다. 완전 오픈 모델 생태계에 MoE와 AMD GPU 기반 학습 사례를 함께 추가했다는 점이 핵심이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.