분산 트레이닝을 위한 AWS 인터커넥트 기술: GPU 간 고속 통신 기술 소개
분산 트레이닝 효율을 높이기 위해 CPU 개입을 단계적으로 제거하는 GPU 간 고속 통신 기술의 발전 과정을 다룬다.
대규모 분산 훈련에서 GPU 간 통신 성능은 전체 효율을 좌우하는 핵심 요소다. 수백 대의 GPU가 그래디언트를 주고받는 환경에서는 데이터가 GPU 메모리에서 원격 노드의 GPU 메모리까지 도달하는 경로를 얼마나 효율적으로 설계하느냐가 성능을 결정한다.
GPUDirect RDMA는 데이터 전송 경로에서 CPU를 우회한다. 기존에는 GPU 메모리의 데이터를 CPU 메모리로 복사한 뒤 네트워크 카드로 전송했으나, 이 기술은 NIC이 PCIe를 통해 GPU 메모리에 직접 접근하여 데이터를 읽는다. 이를 통해 노드 내부의 불필요한 복사 과정을 제거하고 레이턴시를 줄인다.
AWS는 p4d.24xlarge 인스턴스부터 이 기술을 지원하며, **EFA(Elastic Fabric Adapter)**와 결합해 최적화를 극대화한다. GPUDirect RDMA가 데이터 경로의 CPU 개입을 제거한다면, EFA의 커널 바이패스 구조는 노드 간 전송 시 OS 네트워크 스택을 우회한다.
**GPUDirect Async(IBGDA)**는 제어 경로에서 CPU 개입마저 제거한다. GPU 커널이 네트워크 카드의 명령 큐에 직접 쓰기를 수행하여, CPU의 허락 없이 즉시 DMA 전송을 시작한다. NVIDIA 벤치마크에 따르면 IBGDA는 1KB 미만의 소규모 메시지에서 기존 대비 최대 9.5배의 처리량 향상을 달성했다.
최근 MoE(Mixture-of-Experts) 모델의 통신 최적화를 위해, 인피니밴드 진영의 DeepEP와 AWS EFA 진영의 PPLX-kernels가 Expert Parallelism을 지원하는 서로 다른 접근법을 선보이고 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.