AI Briefing

모델마다 승부 역전

TPU v7x Ironwood vs Nvidia B200

·2026.04.18 06:18

핵심 내용

동일한 FP8 조건 비교에서 Ironwood와 B200의 우위가 모델별로 뒤집혔다.

자세히 보기

Google의 Ironwood inference benchmark와 Nvidia의 B200 InferenceMAX 수치를 같은 조건으로 맞춰 비교했다.

  • 비교 대상: Qwen3-32B dense와 Qwen3-Coder-480B-A35B MoE
  • 동일 조건: FP8 e4m3 가중치·활성값·KV cache, 같은 sequence length, concurrency, prompt 수, seed
  • 설정: random 데이터셋, --random-range-ratio 0.8, --num-prompts 320, --max-concurrency 64, --seed 100, --ignore-eos
  • 스택: SGLang 0.5.10 on B200, vLLM-on-TPU on Ironwood
  • 규모: 32B는 1 chip vs 1 GPU, 480B는 4 chips vs 4 GPUs

결과는 모델에 따라 갈렸다. 32B dense에서는 Ironwood가 유리했고, 480B MoE에서는 B200이 특히 8k/1k 구간에서 약 80% 앞섰다.

해석상 dense는 단일 matmul 비중이 높아 Ironwood의 TPU 커널이 강했고, MoE는 expert routing과 dispatch가 핵심이라 SGLang의 MoE 처리와 NVLink all-to-all이 더 잘 최적화된 영향으로 보인다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.