AI Briefing

122B 198t/s

Qwen3.5-122B at 198 tok/s on 2x RTX PRO 6000 Blackwell — Budget build, verified results

·2026.04.10 09:59

핵심 내용

2x RTX PRO 6000 Blackwell에서 Qwen3.5-122B를 198 tok/s로 검증했다.

자세히 보기

2x RTX PRO 6000 Blackwell 96GB와 EPYC 4564P(AM5), 128GB DDR5 ECC, PCIe switch 조합으로 Qwen3.5-122B NVFP4를 약 198 tok/s로 돌린 결과를 공개했다.

핵심은 속도 자체보다 구성비다. 저자는 이 빌드가 Threadripper Pro 워크스테이션보다 저렴하지만, 동일한 2-GPU 추론 성능에 도달할 수 있다고 정리했다. 다만 원래 주장했던 “스위치 토폴로지가 더 빠르다”는 해석은 수정됐고, switch와 direct-attach 모두 실측 P2P latency는 0.38 µs로 동일하다고 밝혔다.

벤치마크는 다음과 같다.

  • Qwen3.5-122B NVFP4: 약 198 tok/s
  • Qwen3.5-27B FP8: 169.7 tok/s
  • MiniMax M2.5 NVFP4: 148.1 tok/s
  • Qwen3.5-122B NVFP4(vLLM): 131.4 tok/s
  • Qwen3.5-397B GGUF: 79 tok/s

122B 결과는 200.3 / 206.7 / 190.2 tok/s의 3회 측정 평균이며, 변동성은 FlashInfer autotuner 비결정성 때문이라고 설명했다.

또 하나의 핵심 포인트는 direct-attach rig에서 NODE/PHB topology일 때 ForceP2P 모듈 설정이 필요할 수 있다는 점이다. 이 설정이 없으면 P2P write가 SysMem staging으로 흘러가고, --enable-pcie-oneshot-allreduce가 사실상 NCCL로 fallback하면서 성능이 떨어질 수 있다고 적었다.

정리하면, 이 글의 결론은 AM5 EPYC + c-payne PM50100 같은 상대적으로 싼 플랫폼으로도, SGLang b12x + NEXTN speculative decoding 조합을 쓰면 2x RTX PRO 6000 Blackwell 기준 Threadripper Pro급 추론 성능을 낼 수 있다는 실측 보고다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.