AI Briefing

NVIDIA Exemplar Cloud: AI 인프라 성능을 최대한 끌어내는 방법

·2026.07.31 09:00

NVIDIA가 AI 클러스터의 성능 격차를 줄이는 네 가지 진단 사례를 공개했다.

동일한 NVIDIA H100, GB200 NVL72, GB300 NVL72 시스템으로 구성한 AI 클러스터도 학습 처리량이 크게 달라질 수 있다. 실제 파트너 배포 환경은 동일한 워크로드·모델·글로벌 배치 크기를 사용해도 NVIDIA 레퍼런스 아키텍처보다 8~12% 느린 경우가 있으며, NVIDIA Exemplar Cloud 검증에 필요한 95% 성능 기준을 넘지 못할 수 있다.

성능 격차는 커널, 하이퍼바이저, BIOS, 메모리 관리, NUMA 배치, NCCL 설정 등 여러 요소에서 발생한 작은 손실이 누적된 결과인 경우가 많다. 이를 확인하기 위해 perf, NVIDIA Nsight Systems, nccl-tests에서 나타나는 구체적인 신호와 조정 방법을 함께 점검한다.

사례는 다음 네 가지 계층을 다룬다.

  • Grace CPU와 가상화: SMMU, IOMMU, 페이지 테이블과 페이지 크기 설정이 커널 오버헤드에 미치는 영향
  • x86 CPU 성능과 NUMA: 전력 관리, 터보 주파수, 프로세스·헬퍼 스레드 배치 문제
  • NCCL 및 네트워크 패브릭: 1.6Tbps 환경에서 큐 페어 동시성과 집단 통신 설정 점검
  • 하드웨어 설치 상태: 소프트웨어 설정만으로 설명되지 않는 조용한 설치 결함 확인

첫 번째 사례에서는 GB200 NVL72 기반 DeepSeek-V3 MoE FP8 사전 학습이 VM에서 베어메탈 레퍼런스 아키텍처보다 12~14% 긴 반복 시간을 보였다. 반면 Llama 3 70B 같은 밀집 모델은 3% 이내의 성능을 냈으며, Nsight Systems 추적에서는 작은 커널이 많은 MoE 워크로드에서 CPU 오버헤드가 크게 증가한 신호가 포착됐다.

진단 전제조건으로는 NVIDIA HGX H100·H200·B200, GB200 NVL72 또는 GB300 NVL72 클러스터, InfiniBand나 RoCE 인터커넥트, 안정적인 반복 시간을 내는 분산 학습 워크로드, 루트 권한, 그리고 학습 스택과 동일한 NCCL 버전으로 빌드한 nccl-tests가 필요하다. 다만 제시된 점검 항목은 실제 애플리케이션 검증을 대체하지 않으며, 플랫폼과 워크로드에 따라 우선적으로 확인할 계층도 달라진다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.