NVIDIA, ModelExpress 공개
ModelExpress: Distributing Model Artifacts at the Speed of Light - NVIDIA Technical Blog
·2026.07.25 17:24
NVIDIA가 GPU-to-GPU RDMA를 활용해 모델 로딩 속도를 획기적으로 높인 ModelExpress를 공개했다.
NVIDIA는 **ModelExpress(MX)**를 통해 DeepSeek-V4 Pro의 스타트업 시간을 8분에서 2분 미만으로 단축하는 데 성공했다. 이 기술은 NVIDIA Dynamo의 가중치 배포 및 캐시 관리 서비스로 작동한다.
핵심 기술적 특징은 다음과 같다:
- GPU-to-GPU RDMA 활용: 가중치를 GPU 메모리로 이동하는 가장 빠른 경로를 사용하여 데이터 전송 효율을 극대화한다.
- NIXL 기반 직접 페칭: 인퍼런스 워커가 중앙 집중식 브로드캐스트를 거치지 않고 NIXL을 통해 다른 GPU로부터 직접 업데이트된 가중치를 가져온다.
- 경로 최적화: 가중치 이동을 크리티컬 패스(Critical Path)에서 분리하여 인퍼런스 및 RL(강화 학습) 포스트 트레이닝의 속도를 모두 향상시킨다.
- 커널 캐시 재사용: MX는 커널 캐시를 재사용하여 리소스 낭비를 줄이고 효율성을 높인다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.