AI Briefing

Q4_K_XL, Q4_K_M보다 빨라

[Qwen3.6 35b a3b] Used the top config for my setup 8gb vram and 32gb ram, and found that somehow the Q4_K_XL model from Unsloth runs just slightly faster and used less tokens for output compared to Q4_K_M despite more memory usage

·2026.04.26 18:51

핵심 내용

8GB VRAM·32GB RAM 환경에서 Q4_K_XL이 Q4_K_M보다 소폭 빠르고 출력 토큰도 적었다.

자세히 보기

Qwen3.6 35b a3b를 8GB VRAM / 32GB RAM 환경에 맞춰 돌린 벤치마크에서, Unsloth의 Q4_K_XL이 Q4_K_M보다 약간 더 나은 성능을 보였다.

  • 설정: CtxSize 131,072, GpuLayers 99, CpuMoeLayers 38, Threads 16, BatchSize/UBatchSize 4096/4096, K/V cache q8_0
  • 비교 결과:
    • Avg Tokens/sec: 28.92 → 29.78
    • Median Tokens/sec: 30.96 → 32.08
    • Avg Wall Seconds: 108.03초 → 99.93초
    • Avg Output Tokens: 3,031.8 → 2,895.8
  • 입력 처리와 디코딩 속도도 소폭 향상됐으며, 입력 토큰 처리 속도는 50.20 → 55.96 tok/s로 늘었다.
  • 작성자는 첫 실행에 저장소에서 RAM으로 모델을 올리는 초기화 시간이 포함돼 있어 실제 사용 기준으로 5회 측정했다고 설명했다.

핵심은 더 많은 메모리를 쓰는 Q4_K_XL이 이 환경에서는 Q4_K_M보다 약 3% 빠르고, 출력 토큰도 약 4.5% 적었다는 점이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.