깊이 스케일링 새축
Mixture-of-Depths Attention - arXiv
·2026.04.20 03:11
핵심 내용
MoDA는 깊이 스케일링을 개선하며 1.5B 모델에서 성능과 효율을 함께 끌어올렸다.
자세히 보기
LLM이 깊어질수록 얕은 층에서 형성된 정보가 residual update에 의해 희석되는 문제를 겨냥해 **Mixture-of-Depths Attention(MoDA)**를 제안한다.
각 attention head가 현재 layer의 KV pair와 더 이전 layer의 depth KV pair를 함께 참조하게 만들어, 깊이 증가로 인한 신호 소실을 완화한다.
또한 비연속 메모리 접근 문제를 해결하는 hardware-efficient algorithm을 함께 제시해, 64K 시퀀스 길이에서 FlashAttention-2의 97.3% 효율을 달성했다.
1.5B 파라미터 모델 실험에서는 강한 baseline 대비 일관된 개선을 보였다.
- 10개 검증 벤치마크 평균 perplexity 0.2 개선
- 10개 downstream task 평균 성능 2.11% 향상
- 추가 FLOPs 오버헤드 **3.7%**로 매우 작음
- post-norm과 결합할 때 pre-norm보다 더 좋은 성능
결론적으로 MoDA는 깊이를 더 키우는 LLM 설계에서 유망한 primitive로 제시된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.