AMD, Instella-MoE 공개
Instella-MoE: AMD Instinct GPU에서 처음부터 학습한 완전 오픈 16B MoE 모델
AMD가 ROCm 기반으로 학습한 완전 오픈 16B MoE 모델을 공개했다.
AMD가 전체 16B 파라미터, 토큰당 활성 2.8B 파라미터 규모의 희소 활성 MoE 언어 모델 Instella-MoE를 공개했다. 모델은 AMD Instinct MI300X·MI325X GPU와 ROCm 소프트웨어 스택만으로 처음부터 학습됐다.
Instella-MoE는 가중치뿐 아니라 다음 학습 자산을 함께 공개하는 완전 오픈 모델을 지향한다.
- 학습 코드와 설정
- 데이터 배합과 단계별 학습 레시피
- 사전학습 및 사후학습 체크포인트
- 중간 체크포인트와 모델 설정 파일
학습에는 AMD의 오픈소스 프레임워크 Primus, 강화학습 기반 사후 학습에는 Miles를 사용했다. 아키텍처에는 Gated MLA와 FarSkip-Collective가 적용됐다.
전체 학습 파이프라인은 1차·2차 사전학습, 미드트레이닝, 롱컨텍스트 확장, 지도 미세조정, 강화학습으로 이어지는 6단계이며, 사전학습에는 총 7.1T 토큰이 사용됐다. 단계별 체크포인트를 통해 미드트레이닝과 사후학습이 모델 능력에 미친 영향도 재현·분석할 수 있다.
공개 자료의 비교 결과에서 Instella-MoE는 활성 파라미터가 2배 이상 많은 OLMo-3-7B보다 높은 성능 대역을 2.8B 활성 파라미터로 달성한 것으로 제시됐다. 완전 오픈 모델 생태계에 MoE와 AMD GPU 기반 학습 사례를 함께 추가했다는 점이 핵심이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.