AI Briefing

NVIDIA Vera Rubin NVL72, MLPerf 추론 벤치마크 데뷔서 GB300 대비 최대 3.7배 성능 달성

·2026.09.17 00:00

핵심 내용

NVIDIA Vera Rubin NVL72가 MLPerf Inference v6.1에서 GB300 대비 최대 3.7배 처리량을 기록하며 선두에 올랐다.

1 / 4

자세히 보기

NVIDIA의 차세대 플랫폼 Vera Rubin NVL72가 MLPerf Inference v6.1 벤치마크에 첫 데뷔하며, 이전 세대인 GB300 NVL72 대비 최대 3.7배 높은 처리량을 달성했다. 이는 AI 추론 경제성의 핵심인 시스템 성능과 인프라 스케일링 효율성을 입증한 결과다.

하드웨어 및 소프트웨어 풀스택 최적화

Vera Rubin NVL72의 성능 향상은 하드웨어와 소프트웨어의 긴밀한 결합(full-stack codesign)에서 비롯됐다. 향상된 Tensor Cores와 Transformer Engine이 추론의 prefill 및 decode 단계를 가속화하며, NVFP4 정밀도 적용으로 메모리 풋프린트를 줄여 출력 품질 손실 없이 처리량을 높였다. 또한 Disaggregated serving(prefill/decode 분리)과 MoE 계층을 위한 대규모 expert parallelism을 활용했다. 특히 6세대 NVLink와 NVLink Switch 기반의 NVL72 scale-up domain은 일반 Ethernet 대비 패킷 전송률을 10배 높이고 지연을 3배 낮췄다.

모델별 성능 및 에이전트 워크로드

벤치마크 세부 결과에서 Qwen3-VL 모델은 vLLM과 NVIDIA Dynamo 프레임워크 사용 시 offline, server, interactive 모든 시나리오에서 GB300 대비 최대 3.7배의 처리량을 보였다. DeepSeek-R1 모델은 TensorRT-LLM 라이브러리 사용 시 최대 2.5배의 성능 향상을 기록했다. 에이전트 워크로드 측면에서는 SemiAnalysis AgentX 벤치마크 preview 테스트에서 GB300 대비 30배 더 나은 성능을 입증했다.

스케일링 효율성과 지속적 소프트웨어 개선

GB300 NVL72는 4개 랙(288-GPU) 구성에서 **99%**의 스케일링 효율을 달성하며, GPU 수 증가에 따라 처리량이 거의 선형적으로 증가함을 보였다. 이는 랙 내 고대역폭 인터커넥트와 노드 간 효율적인 요청 오케스트레이션의 결과다. 또한 NVIDIA는 v6.0 대비 v6.1 제출물에서 최대 1.6배의 성능 향상을 기록했으며, v6.1 마감 이후에도 lower KV cache precision, kernel fusion 등 추가 소프트웨어 최적화를 통해 성능을 계속 개선하고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.