AI Briefing

iGPU로 토큰속도 10%↑

Using the iGPU as the primary graphics card may improve token generation speed for PCIe graphics cards

·2026.04.25 05:09

모니터를 iGPU로 옮기자 llama.cpp 토큰 속도가 50t/s에서 55t/s로 올랐다.

RTX 4070 Super 12GB에서 llama.cpp로 **Qwen3.6 35B A3B UD-IQ3_XXS (Unsloth)**를 돌리던 중, 모니터를 AMD iGPU에 연결해 주 디스플레이를 바꾸자 토큰 생성 속도가 50 t/s에서 55 t/s로 올라 약 10% 개선됐다.

핵심 설정은 다음과 같다.

  • llama-server 사용
  • --fit on, --fit-target 256
  • --flash-attn on
  • --no-mmap, --mlock
  • --no-context-shift
  • --fit-ctx 262144, --predict 32768
  • --cache-type-k q4_0, --cache-type-v q4_0
  • --threads 8, --threads-batch 8

모니터 출력을 iGPU로 넘겨 PCIe GPU의 VRAM을 더 많이 추론에 쓰게 하면, 일부 환경에서는 생성 속도 개선이 가능하다는 사례다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.