모델마다 승부 역전
TPU v7x Ironwood vs Nvidia B200
·2026.04.18 06:18
핵심 내용
동일한 FP8 조건 비교에서 Ironwood와 B200의 우위가 모델별로 뒤집혔다.
자세히 보기
Google의 Ironwood inference benchmark와 Nvidia의 B200 InferenceMAX 수치를 같은 조건으로 맞춰 비교했다.
- 비교 대상: Qwen3-32B dense와 Qwen3-Coder-480B-A35B MoE
- 동일 조건: FP8 e4m3 가중치·활성값·KV cache, 같은 sequence length, concurrency, prompt 수, seed
- 설정:
random데이터셋,--random-range-ratio 0.8,--num-prompts 320,--max-concurrency 64,--seed 100,--ignore-eos - 스택: SGLang 0.5.10 on B200, vLLM-on-TPU on Ironwood
- 규모: 32B는 1 chip vs 1 GPU, 480B는 4 chips vs 4 GPUs
결과는 모델에 따라 갈렸다. 32B dense에서는 Ironwood가 유리했고, 480B MoE에서는 B200이 특히 8k/1k 구간에서 약 80% 앞섰다.
해석상 dense는 단일 matmul 비중이 높아 Ironwood의 TPU 커널이 강했고, MoE는 expert routing과 dispatch가 핵심이라 SGLang의 MoE 처리와 NVLink all-to-all이 더 잘 최적화된 영향으로 보인다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.