NVIDIA Vera Rubin NVL72, MLPerf 추론 벤치마크 데뷔서 GB300 대비 최대 3.7배 성능 달성
핵심 내용
NVIDIA Vera Rubin NVL72가 MLPerf Inference v6.1에서 GB300 대비 최대 3.7배 처리량을 기록하며 선두에 올랐다.
자세히 보기
NVIDIA의 차세대 플랫폼 Vera Rubin NVL72가 MLPerf Inference v6.1 벤치마크에 첫 데뷔하며, 이전 세대인 GB300 NVL72 대비 최대 3.7배 높은 처리량을 달성했다. 이는 AI 추론 경제성의 핵심인 시스템 성능과 인프라 스케일링 효율성을 입증한 결과다.
하드웨어 및 소프트웨어 풀스택 최적화
Vera Rubin NVL72의 성능 향상은 하드웨어와 소프트웨어의 긴밀한 결합(full-stack codesign)에서 비롯됐다. 향상된 Tensor Cores와 Transformer Engine이 추론의 prefill 및 decode 단계를 가속화하며, NVFP4 정밀도 적용으로 메모리 풋프린트를 줄여 출력 품질 손실 없이 처리량을 높였다. 또한 Disaggregated serving(prefill/decode 분리)과 MoE 계층을 위한 대규모 expert parallelism을 활용했다. 특히 6세대 NVLink와 NVLink Switch 기반의 NVL72 scale-up domain은 일반 Ethernet 대비 패킷 전송률을 10배 높이고 지연을 3배 낮췄다.
모델별 성능 및 에이전트 워크로드
벤치마크 세부 결과에서 Qwen3-VL 모델은 vLLM과 NVIDIA Dynamo 프레임워크 사용 시 offline, server, interactive 모든 시나리오에서 GB300 대비 최대 3.7배의 처리량을 보였다. DeepSeek-R1 모델은 TensorRT-LLM 라이브러리 사용 시 최대 2.5배의 성능 향상을 기록했다. 에이전트 워크로드 측면에서는 SemiAnalysis AgentX 벤치마크 preview 테스트에서 GB300 대비 30배 더 나은 성능을 입증했다.
스케일링 효율성과 지속적 소프트웨어 개선
GB300 NVL72는 4개 랙(288-GPU) 구성에서 **99%**의 스케일링 효율을 달성하며, GPU 수 증가에 따라 처리량이 거의 선형적으로 증가함을 보였다. 이는 랙 내 고대역폭 인터커넥트와 노드 간 효율적인 요청 오케스트레이션의 결과다. 또한 NVIDIA는 v6.0 대비 v6.1 제출물에서 최대 1.6배의 성능 향상을 기록했으며, v6.1 마감 이후에도 lower KV cache precision, kernel fusion 등 추가 소프트웨어 최적화를 통해 성능을 계속 개선하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.