AWS, 파운데이션 모델 인프라 정리
Building Blocks for Foundation Model Training and Inference on AWS
·2026.05.12 08:18
AWS가 파운데이션 모델 학습·추론용 인프라 스택과 최신 GPU/EFA 구성을 정리했다.
AWS가 파운데이션 모델 학습·추론 스택을 compute, network, storage, orchestration, observability의 계층으로 나눠 정리했다.
핵심 인프라는 P5/P5e/P5en/P6 GPU 인스턴스군과 EFA 네트워크다. 특히 P6는 B200/B300를 도입해 노드 내 NVLink/NVSwitch와 노드 간 EFA를 함께 쓰는 구성을 강조하며, H100·H200·B200·B300의 Tensor throughput, HBM 용량, HBM 대역폭을 비교해 대규모 분산 학습과 추론의 병목이 계산보다 통신과 메모리 이동에 있다는 점을 보여준다.
- EFA는 OS-bypass RDMA를 제공한다.
EFAv3는EFAv2대비 패킷 지연을 약 35% 줄인다.EFAv4는EFAv3대비 집합 통신 성능을 추가로 18% 높인다.- 저장소는 NVMe instance store, FSx for Lustre, S3로 계층화해 체크포인트와 데이터 적재를 분담한다.
- 자원 관리는 Slurm과 Kubernetes, 개발은 PyTorch와 JAX, 관측은 Prometheus와 Grafana 중심으로 설명한다.
대규모 배치는 Amazon EC2 UltraClusters로 구성해 수천 대의 가속 인스턴스를 하나의 Availability Zone에 밀집 배치하고, petabit-scale nonblocking 네트워크로 묶는 구조를 제시한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.