AI Briefing

KDA 2.22배

Moonshot open-sourced FlashKDA, CUTLASS kernels for Kimi Delta Attention, up to 2.22x over the Triton baseline on H20

·2026.04.22 09:15

핵심 내용

Moonshot이 FlashKDA를 공개했고, H20에서 Triton 대비 최대 2.22배 빨라졌다.

자세히 보기

MoonshotAI가 FlashKDA를 오픈소스로 공개했다. **Kimi Delta Attention(KDA)**용 CUTLASS C++ forward kernel로, flash-linear-attention의 백엔드로 연결된다.

벤치마크는 H20에서 측정됐고, 기존 Triton baseline 대비 성능 향상이 확인됐다.

  • T=8192, H=96, D=128 고정 길이: 1.72x
  • variable length / mixed seq_lens: 1.95x
  • variable length / uniform 1024x8: 2.22x

의미는 분명하다. 선형 어텐션 계열은 이론상 길이 증가에 유리하지만, 실제 성능은 커널 구현이 좌우한다. FlashKDA는 SM90 이상, CUDA 12.9 이상, PyTorch 2.4 이상을 요구하며, MIT 라이선스로 배포된다.

다만 현재 공개된 수치는 forward pass만 기준이고, H20에서만 측정됐다. H100이나 Blackwell에서의 절대 성능은 달라질 수 있으며, backward kernel은 아직 공개되지 않았다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.