AI Briefing

RTX6k Qwen3.5 벤치마크 갱신

Updated: RTX6k (Server, 450w) Qwen3.5-122B-A10B (MXFP4_MOE) Benchmarks (llama.cpp)

·2026.05.03 08:11

핵심 내용

llama.cpp 최신 빌드로 RTX6k Qwen3.5 벤치마크가 크게 개선됐다.

자세히 보기

llama.cpp를 b8198 -> d05fe1d로 올린 뒤 같은 모델, 같은 하드웨어, 같은 플래그로 RTX6k(Server, 450W)에서 Qwen3.5-122B-A10B(MXFP4_MOE)를 다시 측정했다. CUDA toolkit은 13.0 그대로였고, 새 빌드는 hybrid SSM/MoE speculative decode, native NVFP4 MMQ for SM120, server prompt cache와 최근 2개월간의 MoE/MXFP4 커널 개선을 포함한다.

측정은 운영 중인 서버의 v1/completions endpoint에 synthetic prompt를 넣어 수행했다. cache_prompt:false, n_predict=128-256, temperature=0, chat_template_kwargs.enable_thinking=false를 사용했고, 속도는 서버 응답에서 파싱했다. 운영 설정은 --parallel 4에서 --parallel 2로 바꿨다.

주요 결과는 다음과 같다.

  • pp512: 2,188 -> 3,176 t/s, +45%
  • tg single-stream: 80.0 -> 106.6 t/s, +33%
  • tg per-req @ c=2: 55.7 -> 89.3 t/s, +60%
  • Total tg @ c=2: 111.4 -> 178.6 t/s, +60%
  • pp 8K / 32K / 65K: +69% / +65% / +59%
  • tg 8K / 32K / 65K: +35% / +35% / +28%
  • TTFT 8K / 32K / 65K: 2,780 / 10,780 / 23,161 ms -> 1,877 / 7,955 / 17,737 ms

prompt processing 개선 폭이 token generation보다 더 컸고, TG는 0->65K에서 약 -13% 하락해 이전의 **-10%**와 비슷한 기울기를 유지했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.