iGPU로 토큰속도 10%↑
Using the iGPU as the primary graphics card may improve token generation speed for PCIe graphics cards
·2026.04.25 05:09
핵심 내용
모니터를 iGPU로 옮기자 llama.cpp 토큰 속도가 50t/s에서 55t/s로 올랐다.
자세히 보기
RTX 4070 Super 12GB에서 llama.cpp로 **Qwen3.6 35B A3B UD-IQ3_XXS (Unsloth)**를 돌리던 중, 모니터를 AMD iGPU에 연결해 주 디스플레이를 바꾸자 토큰 생성 속도가 50 t/s에서 55 t/s로 올라 약 10% 개선됐다.
핵심 설정은 다음과 같다.
llama-server사용--fit on,--fit-target 256--flash-attn on--no-mmap,--mlock--no-context-shift--fit-ctx 262144,--predict 32768--cache-type-k q4_0,--cache-type-v q4_0--threads 8,--threads-batch 8
모니터 출력을 iGPU로 넘겨 PCIe GPU의 VRAM을 더 많이 추론에 쓰게 하면, 일부 환경에서는 생성 속도 개선이 가능하다는 사례다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.