AI Briefing

llama.cpp flash-attn추가

ggml-cuda: add flash-attn support for DKQ=320/DV=256 with ncols2=32 (… by lnigam · Pull Request #22286 · ggml-org/llama.cpp

·2026.04.29 06:48

핵심 내용

llama.cpp에 Mistral Small 4용 DKQ=320/DV=256 flash-attn CUDA 지원이 추가됐다.

자세히 보기

ggml-cuda에 DKQ=320 / DV=256용 flash-attn 커널이 추가됐다. ncols2=32로 제한해 Mistral Small 4의 GQA=32 조합에서 발생하던 CPU fallback을 CUDA 경로로 넘기는 것이 핵심이다.

패치는 MMA-f16 및 tile kernel config, 디스패치 로직, 템플릿 인스턴스, Mistral Small 4용 tile .cu 파일을 포함한다.

벤치마크는 NVIDIA RTX PRO 6000 Blackwell Workstation Edition에서 측정됐다.

  • 변경 전: pp512 179.64±2.66, tg32 33.05±0.30
  • ncols2=32: pp512 3752.47±26.33, tg32 185.92±4.43
  • ncols2=8: pp512 3678.35±21.68, tg32 182.24±4.00

후속 수정에서는 ncols=32에서 워프 그룹별 base index가 빠져 CPU 결과와 어긋나던 버그를 고쳤고, sinks=1이 포함된 FLASH_ATTN_EXT 실패도 해결했다. 최신 재테스트에서는 pp512 3655.55±15.81, tg32 186.31±4.23을 확인했다.

다중 GPU 환경에서도 pp512가 348.35 → 1310.13, tg128이 59.12 → 93.06으로 개선됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.