AI Briefing

깊이 스케일링 새축

Mixture-of-Depths Attention - arXiv

·2026.04.20 03:11

핵심 내용

MoDA는 깊이 스케일링을 개선하며 1.5B 모델에서 성능과 효율을 함께 끌어올렸다.

자세히 보기

LLM이 깊어질수록 얕은 층에서 형성된 정보가 residual update에 의해 희석되는 문제를 겨냥해 **Mixture-of-Depths Attention(MoDA)**를 제안한다.

각 attention head가 현재 layer의 KV pair와 더 이전 layer의 depth KV pair를 함께 참조하게 만들어, 깊이 증가로 인한 신호 소실을 완화한다.

또한 비연속 메모리 접근 문제를 해결하는 hardware-efficient algorithm을 함께 제시해, 64K 시퀀스 길이에서 FlashAttention-2의 97.3% 효율을 달성했다.

1.5B 파라미터 모델 실험에서는 강한 baseline 대비 일관된 개선을 보였다.

  • 10개 검증 벤치마크 평균 perplexity 0.2 개선
  • 10개 downstream task 평균 성능 2.11% 향상
  • 추가 FLOPs 오버헤드 **3.7%**로 매우 작음
  • post-norm과 결합할 때 pre-norm보다 더 좋은 성능

결론적으로 MoDA는 깊이를 더 키우는 LLM 설계에서 유망한 primitive로 제시된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.