RTX6k Qwen3.5 벤치마크 갱신
Updated: RTX6k (Server, 450w) Qwen3.5-122B-A10B (MXFP4_MOE) Benchmarks (llama.cpp)
핵심 내용
llama.cpp 최신 빌드로 RTX6k Qwen3.5 벤치마크가 크게 개선됐다.
자세히 보기
llama.cpp를 b8198 -> d05fe1d로 올린 뒤 같은 모델, 같은 하드웨어, 같은 플래그로 RTX6k(Server, 450W)에서 Qwen3.5-122B-A10B(MXFP4_MOE)를 다시 측정했다. CUDA toolkit은 13.0 그대로였고, 새 빌드는 hybrid SSM/MoE speculative decode, native NVFP4 MMQ for SM120, server prompt cache와 최근 2개월간의 MoE/MXFP4 커널 개선을 포함한다.
측정은 운영 중인 서버의 v1/completions endpoint에 synthetic prompt를 넣어 수행했다. cache_prompt:false, n_predict=128-256, temperature=0, chat_template_kwargs.enable_thinking=false를 사용했고, 속도는 서버 응답에서 파싱했다. 운영 설정은 --parallel 4에서 --parallel 2로 바꿨다.
주요 결과는 다음과 같다.
- pp512: 2,188 -> 3,176 t/s, +45%
- tg single-stream: 80.0 -> 106.6 t/s, +33%
- tg per-req @ c=2: 55.7 -> 89.3 t/s, +60%
- Total tg @ c=2: 111.4 -> 178.6 t/s, +60%
- pp 8K / 32K / 65K: +69% / +65% / +59%
- tg 8K / 32K / 65K: +35% / +35% / +28%
- TTFT 8K / 32K / 65K: 2,780 / 10,780 / 23,161 ms -> 1,877 / 7,955 / 17,737 ms
prompt processing 개선 폭이 token generation보다 더 컸고, TG는 0->65K에서 약 -13% 하락해 이전의 **-10%**와 비슷한 기울기를 유지했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.