SkewAdam, MoE 메모리 97% 절감
SkewAdam: A tiered optimizer that cuts MoE state memory by 97% (fits a 6.7B MoE on a 40GB GPU) [R]
·2026.07.22 16:04
새 옵티마이저 SkewAdam이 MoE 훈련 시 옵티마이저 상태 메모리를 50.6GB에서 1.29GB로 줄여 40GB GPU 한 장으로 6.78B MoE 학습을 가능하게 했다.
arXiv에 공개된 프리프린트 논문에서 제안된 SkewAdam은 Mixture-of-Experts(MoE) 모델 훈련의 VRAM 병목을 해소하기 위한 계층형 옵티마이저다.
기존 AdamW는 12.6GB 모델에 50.6GB의 옵티마이저 상태 메모리를 요구하지만, SkewAdam은 파라미터 역할에 따라 정밀도를 차등 적용한다:
- Backbone (전체의 5%): 모멘텀 + 인수분해된 2차 모멘트
- Experts (전체의 95%): 인수분해된 2차 모멘트만
- Router (<0.01%): 정확한 2차 모멘트
이 접근으로 옵티마이저 상태 메모리가 50.6GB → 1.29GB(97.4% 감소), 피크 훈련 메모리가 81.4GB → 31.3GB로 줄어 6.78B MoE 모델을 40GB GPU 단일 카드에서 수렴 품질 및 라우터 안정성 저하 없이 훈련할 수 있다고 보고했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.