AMD Strix Halo용 Luce DFlash 지원
Luce DFlash + PFlash on AMD Strix Halo: Qwen3.6-27B at 2.23x decode and 3.05x prefill vs llama.cpp HIP
·2026.05.13 03:09
핵심 내용
AMD Strix Halo iGPU에서 Luce DFlash/PFlash를 통해 LLM 추론 성능을 최대 3배 이상 향상시켰다.
자세히 보기
오픈소스 프로젝트 lucebox-hub가 AMD Ryzen AI MAX+ 395(Strix Halo) iGPU를 위한 DFlash 및 PFlash 지원을 공개했다. 이는 기존 Luce DFlash 스택을 소비자용 AMD APU 환경에 최적화한 결과다.
Qwen3.6-27B (Q4_K_M) 모델을 대상으로 llama.cpp HIP와 성능을 비교한 결과는 다음과 같다:
- 디코드(Decode): 26.85 tok/s (2.23배 향상)
- 프리필(Prefill, 16K context): 20.2s (3.05배 향상)
16K 프롬프트와 1K 생성 워크로드 기준, 전체 실행 시간은 147초에서 58초로 단축되어 2.5배 빠른 엔드 투 엔드 성능을 기록했다.
특히 128 GiB 통합 메모리를 활용함으로써, 기존 24 GiB VRAM을 가진 소비자용 GPU로는 구동하기 어려운 대규모 모델(Qwen3.5-122B-A10B 등)을 로컬 환경에서 효율적으로 실행할 수 있는 이점을 제공한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.