iGPU로 토큰속도 10%↑
Using the iGPU as the primary graphics card may improve token generation speed for PCIe graphics cards
·2026.04.25 05:09
모니터를 iGPU로 옮기자 llama.cpp 토큰 속도가 50t/s에서 55t/s로 올랐다.
RTX 4070 Super 12GB에서 llama.cpp로 **Qwen3.6 35B A3B UD-IQ3_XXS (Unsloth)**를 돌리던 중, 모니터를 AMD iGPU에 연결해 주 디스플레이를 바꾸자 토큰 생성 속도가 50 t/s에서 55 t/s로 올라 약 10% 개선됐다.
핵심 설정은 다음과 같다.
llama-server사용--fit on,--fit-target 256--flash-attn on--no-mmap,--mlock--no-context-shift--fit-ctx 262144,--predict 32768--cache-type-k q4_0,--cache-type-v q4_0--threads 8,--threads-batch 8
모니터 출력을 iGPU로 넘겨 PCIe GPU의 VRAM을 더 많이 추론에 쓰게 하면, 일부 환경에서는 생성 속도 개선이 가능하다는 사례다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.