AWS, 파운데이션 모델 인프라 정리
Building Blocks for Foundation Model Training and Inference on AWS
·2026.05.12 08:18
핵심 내용
AWS가 파운데이션 모델 학습·추론용 인프라 스택과 최신 GPU/EFA 구성을 정리했다.
1 / 2
자세히 보기
AWS가 파운데이션 모델 학습·추론 스택을 compute, network, storage, orchestration, observability의 계층으로 나눠 정리했다.
핵심 인프라는 P5/P5e/P5en/P6 GPU 인스턴스군과 EFA 네트워크다. 특히 P6는 B200/B300를 도입해 노드 내 NVLink/NVSwitch와 노드 간 EFA를 함께 쓰는 구성을 강조하며, H100·H200·B200·B300의 Tensor throughput, HBM 용량, HBM 대역폭을 비교해 대규모 분산 학습과 추론의 병목이 계산보다 통신과 메모리 이동에 있다는 점을 보여준다.
- EFA는 OS-bypass RDMA를 제공한다.
EFAv3는EFAv2대비 패킷 지연을 약 35% 줄인다.EFAv4는EFAv3대비 집합 통신 성능을 추가로 18% 높인다.- 저장소는 NVMe instance store, FSx for Lustre, S3로 계층화해 체크포인트와 데이터 적재를 분담한다.
- 자원 관리는 Slurm과 Kubernetes, 개발은 PyTorch와 JAX, 관측은 Prometheus와 Grafana 중심으로 설명한다.
대규모 배치는 Amazon EC2 UltraClusters로 구성해 수천 대의 가속 인스턴스를 하나의 Availability Zone에 밀집 배치하고, petabit-scale nonblocking 네트워크로 묶는 구조를 제시한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.