AI Briefing

llama.cpp flash-attn추가

ggml-cuda: add flash-attn support for DKQ=320/DV=256 with ncols2=32 (… by lnigam · Pull Request #22286 · ggml-org/llama.cpp

·2026.04.29 06:48

llama.cpp에 Mistral Small 4용 DKQ=320/DV=256 flash-attn CUDA 지원이 추가됐다.

ggml-cudaDKQ=320 / DV=256용 flash-attn 커널이 추가됐다. ncols2=32로 제한해 Mistral Small 4GQA=32 조합에서 발생하던 CPU fallback을 CUDA 경로로 넘기는 것이 핵심이다.

패치는 MMA-f16 및 tile kernel config, 디스패치 로직, 템플릿 인스턴스, Mistral Small 4용 tile .cu 파일을 포함한다.

벤치마크는 NVIDIA RTX PRO 6000 Blackwell Workstation Edition에서 측정됐다.

  • 변경 전: pp512 179.64±2.66, tg32 33.05±0.30
  • ncols2=32: pp512 3752.47±26.33, tg32 185.92±4.43
  • ncols2=8: pp512 3678.35±21.68, tg32 182.24±4.00

후속 수정에서는 ncols=32에서 워프 그룹별 base index가 빠져 CPU 결과와 어긋나던 버그를 고쳤고, sinks=1이 포함된 FLASH_ATTN_EXT 실패도 해결했다. 최신 재테스트에서는 pp512 3655.55±15.81, tg32 186.31±4.23을 확인했다.

다중 GPU 환경에서도 pp512348.35 → 1310.13, tg12859.12 → 93.06으로 개선됐다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.