AI Briefing

ModelExpress: 모델 아티팩트를 빛의 속도로 배포하기

·2026.07.27 09:00

NVIDIA ModelExpress는 GPU 간 직접 데이터 전송을 통해 모델 가중치 로딩 속도를 획기적으로 단축한다.

모델 체크포인트가 수백 GB에서 TB 단위로 커짐에 따라, 클러스터 내에서 모델 가중치를 이동시키는 비용이 급증하고 있습니다. 콜드 스타트, 오토스케일링, RL 포스트 트레이닝 등 모든 워크플로우에서 가중치 이동은 유효한 작업 시작 전 반드시 거쳐야 하는 '시간적 세금'으로 작용합니다.

**NVIDIA ModelExpress (MX)**는 모델을 로드하기 전, 호환 가능한 가중치 복사본이 어디에 있는지 먼저 확인하는 단순한 아이디어를 기반으로 설계되었습니다. 모든 복제본을 독립적인 콜드 스타트로 처리하는 대신, 가장 빠른 소스와 전송 경로를 선택합니다.

주요 동작 방식은 다음과 같습니다:

  • P2P RDMA 전송: 서비스 중인 피어(Peer)가 이미 호환되는 가중치를 GPU에 보유하고 있다면, **NVIDIA Inference Xfer Library (NIXL)**를 통해 GPU에서 GPU로 직접 전송합니다. 이 과정에서 오브젝트 스토리지, 로컬 디스크, 호스트 메모리에 대한 중복 액세스를 제거합니다.
  • 스토리지 부트스트랩: 사용 가능한 피어가 없는 경우, 오브젝트 스토리지에서 직접 스트리밍하여 디스크에 저장하거나 로컬 파일을 직접 읽는 과정을 생략하고 가장 빠른 경로로 부트스트랩합니다.

실제 성능 측정 결과, MX는 DeepSeek-V4 Pro 가중치와 JIT 커널 캐시 아티팩트를 서비스 복제본에서 새 복제본으로 10초 미만에 전송했습니다. 이를 통해 전체 스타트업 시간을 기존 8분에서 1분 44초로 단축하는 놀라운 성과를 보여주었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.