AMD Strix Halo용 Luce DFlash 지원
Luce DFlash + PFlash on AMD Strix Halo: Qwen3.6-27B at 2.23x decode and 3.05x prefill vs llama.cpp HIP
·2026.05.13 03:09
AMD Strix Halo iGPU에서 Luce DFlash/PFlash를 통해 LLM 추론 성능을 최대 3배 이상 향상시켰다.
오픈소스 프로젝트 lucebox-hub가 AMD Ryzen AI MAX+ 395(Strix Halo) iGPU를 위한 DFlash 및 PFlash 지원을 공개했다. 이는 기존 Luce DFlash 스택을 소비자용 AMD APU 환경에 최적화한 결과다.
Qwen3.6-27B (Q4_K_M) 모델을 대상으로 llama.cpp HIP와 성능을 비교한 결과는 다음과 같다:
- 디코드(Decode): 26.85 tok/s (2.23배 향상)
- 프리필(Prefill, 16K context): 20.2s (3.05배 향상)
16K 프롬프트와 1K 생성 워크로드 기준, 전체 실행 시간은 147초에서 58초로 단축되어 2.5배 빠른 엔드 투 엔드 성능을 기록했다.
특히 128 GiB 통합 메모리를 활용함으로써, 기존 24 GiB VRAM을 가진 소비자용 GPU로는 구동하기 어려운 대규모 모델(Qwen3.5-122B-A10B 등)을 로컬 환경에서 효율적으로 실행할 수 있는 이점을 제공한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.