분산 트레이닝을 위한 AWS 인터커넥트 기술: GPU 간 고속 통신 기술 소개
핵심 내용
분산 트레이닝 효율을 높이기 위해 CPU 개입을 단계적으로 제거하는 GPU 간 고속 통신 기술의 발전 과정을 다룬다.
자세히 보기
대규모 분산 훈련에서 GPU 간 통신 성능은 전체 효율을 좌우하는 핵심 요소다. 수백 대의 GPU가 그래디언트를 주고받는 환경에서는 데이터가 GPU 메모리에서 원격 노드의 GPU 메모리까지 도달하는 경로를 얼마나 효율적으로 설계하느냐가 성능을 결정한다.
GPUDirect RDMA는 데이터 전송 경로에서 CPU를 우회한다. 기존에는 GPU 메모리의 데이터를 CPU 메모리로 복사한 뒤 네트워크 카드로 전송했으나, 이 기술은 NIC이 PCIe를 통해 GPU 메모리에 직접 접근하여 데이터를 읽는다. 이를 통해 노드 내부의 불필요한 복사 과정을 제거하고 레이턴시를 줄인다.
AWS는 p4d.24xlarge 인스턴스부터 이 기술을 지원하며, **EFA(Elastic Fabric Adapter)**와 결합해 최적화를 극대화한다. GPUDirect RDMA가 데이터 경로의 CPU 개입을 제거한다면, EFA의 커널 바이패스 구조는 노드 간 전송 시 OS 네트워크 스택을 우회한다.
**GPUDirect Async(IBGDA)**는 제어 경로에서 CPU 개입마저 제거한다. GPU 커널이 네트워크 카드의 명령 큐에 직접 쓰기를 수행하여, CPU의 허락 없이 즉시 DMA 전송을 시작한다. NVIDIA 벤치마크에 따르면 IBGDA는 1KB 미만의 소규모 메시지에서 기존 대비 최대 9.5배의 처리량 향상을 달성했다.
최근 MoE(Mixture-of-Experts) 모델의 통신 최적화를 위해, 인피니밴드 진영의 DeepEP와 AWS EFA 진영의 PPLX-kernels가 Expert Parallelism을 지원하는 서로 다른 접근법을 선보이고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.