AI Briefing

Llama.cpp, PDL 지원 추가

Blackwell and PDL performance increase

·2026.05.23 06:09

Llama.cpp가 Blackwell GPU용 PDL 지원을 추가해 토큰 생성 속도가 4-10% 향상됨

Llama.cpp가 PR 22522를 통해 Nvidia Blackwell GPU(CC ≥ 90)의 Programmatic Dependent Launch(PDL) 기능을 지원하기 시작했다. PDL은 커널 실행을 더 효율적으로 처리해 성능을 개선하는 기술이다.

활성화 방법

빌드 시 -D GGML_CUDA_PDL=ON 플래그를 사용해야 하며, 현재는 기본 비활성화 상태다. 비활성화가 필요하면 export GGML_CUDA_PDL=0를 실행하면 된다.

성능 개선 결과

RTX Pro 4500 Blackwell 32GB에서 여러 모델을 테스트한 결과:

  • Pre-fill(pp512): 거의 차이 없음
  • 토큰 생성(tg128): 평균 5-6% 성능 향상
    • Qwen 3.6 35B UD-Q5_K_XL: 9.17% 향상
    • Qwen 3.6 35B MXFP4: 5.97% 향상
    • Gemma 4 26B NVFP4: 4.95% 향상

아직 모든 커널에 PDL이 적용되지 않았기 때문에 추가 최적화 여지가 남아있다. Blackwell GPU 사용자에게는 빌드 플래그 하나로 얻을 수 있는 무료 성능 개선이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.