AI Briefing

iGPU로 토큰속도 10%↑

Using the iGPU as the primary graphics card may improve token generation speed for PCIe graphics cards

·2026.04.25 05:09

핵심 내용

모니터를 iGPU로 옮기자 llama.cpp 토큰 속도가 50t/s에서 55t/s로 올랐다.

자세히 보기

RTX 4070 Super 12GB에서 llama.cpp로 **Qwen3.6 35B A3B UD-IQ3_XXS (Unsloth)**를 돌리던 중, 모니터를 AMD iGPU에 연결해 주 디스플레이를 바꾸자 토큰 생성 속도가 50 t/s에서 55 t/s로 올라 약 10% 개선됐다.

핵심 설정은 다음과 같다.

  • llama-server 사용
  • --fit on, --fit-target 256
  • --flash-attn on
  • --no-mmap, --mlock
  • --no-context-shift
  • --fit-ctx 262144, --predict 32768
  • --cache-type-k q4_0, --cache-type-v q4_0
  • --threads 8, --threads-batch 8

모니터 출력을 iGPU로 넘겨 PCIe GPU의 VRAM을 더 많이 추론에 쓰게 하면, 일부 환경에서는 생성 속도 개선이 가능하다는 사례다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.