llama.cpp flash-attn추가
ggml-cuda: add flash-attn support for DKQ=320/DV=256 with ncols2=32 (… by lnigam · Pull Request #22286 · ggml-org/llama.cpp
llama.cpp에 Mistral Small 4용 DKQ=320/DV=256 flash-attn CUDA 지원이 추가됐다.
ggml-cuda에 DKQ=320 / DV=256용 flash-attn 커널이 추가됐다. ncols2=32로 제한해 Mistral Small 4의 GQA=32 조합에서 발생하던 CPU fallback을 CUDA 경로로 넘기는 것이 핵심이다.
패치는 MMA-f16 및 tile kernel config, 디스패치 로직, 템플릿 인스턴스, Mistral Small 4용 tile .cu 파일을 포함한다.
벤치마크는 NVIDIA RTX PRO 6000 Blackwell Workstation Edition에서 측정됐다.
- 변경 전:
pp512179.64±2.66,tg3233.05±0.30 ncols2=32:pp5123752.47±26.33,tg32185.92±4.43ncols2=8:pp5123678.35±21.68,tg32182.24±4.00
후속 수정에서는 ncols=32에서 워프 그룹별 base index가 빠져 CPU 결과와 어긋나던 버그를 고쳤고, sinks=1이 포함된 FLASH_ATTN_EXT 실패도 해결했다. 최신 재테스트에서는 pp512 3655.55±15.81, tg32 186.31±4.23을 확인했다.
다중 GPU 환경에서도 pp512가 348.35 → 1310.13, tg128이 59.12 → 93.06으로 개선됐다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.