Token AI, 새로운 옵티마이저 STAM 발표
A new generation of AI models and one of the most powerful research papers out there.
·2026.05.08 14:38
Token AI가 학습 안정성을 높이고 메모리 효율을 극대화한 새로운 옵티마이저 STAM을 발표했다.
Token AI가 발표한 **STAM(Stable Training with Adaptive Momentum)**은 기존 Adam, AdamW와 같은 옵티마이저의 한계를 극복하기 위해 설계된 새로운 알고리즘입니다.
기존 Adam 계열 옵티마이저는 고정된 beta1 값을 사용하여, 학습 과정 중 노이즈가 발생하거나 방향이 급격히 바뀔 때 과거의 모멘텀이 잘못된 방향으로 모델을 유도하는 문제가 있었습니다. STAM은 현재 그래디언트와 이전 모멘텀의 차이($g - m$) 및 잔차 분산을 측정하여 beta1을 동적으로 조절함으로써 학습 안정성을 높이고 스스로 오류를 수정합니다.
특히 경량화 버전인 STAMLite는 AdamW를 대체할 수 있는 효율적인 대안으로 제시되었습니다.
- 메모리 효율성: AdamW가 파라미터 크기의 약 2배를 사용하는 반면, STAMLite는 약 1배 수준의 옵티마이저 상태 메모리만 필요합니다.
- 자원 절감: 이를 통해 기존 방식 대비 약 50%의 리소스를 절감할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.