AWS, SageMaker·IoT Greengrass 활용 Physical AI 학습 파이프라인 구축 가이드 공개
핵심 내용
SageMaker와 IoT Greengrass로 시뮬레이션부터 엣지 배포까지 연결하는 인프라 전략 제시
자세히 보기
AWS가 Physical AI 학습 파이프라인 구축을 위한 상세 가이드를 공개했다. 실제 로봇 학습의 시간과 비용, 파손 위험을 줄이기 위해 시뮬레이션 기반 학습(Sim-to-Real)이 필수적인 상황에서, 학습, 시뮬레이션, 엣지 배포라는 세 가지 컴퓨팅 환경의 하드웨어 요구사항 차이를 분석하고 최적의 인프라 구성을 제안한다.
학습 환경 및 인프라 구성
단발성 fine-tuning에는 인스턴스 자동 종료로 비용을 최소화하는 SageMaker Training Job을, 수일~수주 간의 장기 반복 실험에는 지속적 환경을 유지하는 SageMaker HyperPod를 권장한다. 시뮬레이션 워크스테이션에는 Isaac Sim 렌더링에 필요한 RTX 코어를 갖춘 EC2 G6e(L40S GPU)를 사용하고, 학습용 GPU(A100/H100)와 분리해 비용 효율성을 높인다. 데이터 저장소로는 Amazon S3와 FSx for Lustre를 허브로 활용하여 학습, 평가, 배포 파이프라인을 모듈식으로 연결한다.
VLA 및 RL 트랙 구현
VLA 트랙에서는 NVIDIA GR00T N1.x 모델을 SO-101 로봇 팔 데이터셋으로 fine-tuning한다. SageMaker Pipelines를 통해 데이터 변환부터 모델 등록까지 자동화하며, 워크스테이션의 Isaac Lab에서 Closed-loop 평가를 수행한다. RL 트랙은 HyperPod Slurm 클러스터에서 PPO 알고리즘으로 학습하며, 2,048개 환경을 동시 시뮬레이션하여 초당 약 4만 스텝의 성능을 달성한다.
엣지 배포 및 최적화
학습된 모델은 AWS IoT Greengrass를 통해 NVIDIA Jetson 등 엣지 디바이스로 배포된다. TensorRT 최적화를 적용하면 서버(L40S)에서 PyTorch 대비 2.1배, 엣지(Thor)에서 1.26배의 지연 시간 개선 효과를 얻을 수 있다. Greengrass 컴포넌트 구조를 통해 모델 교체 시 설정 변경만으로 배포를 단순화하며, X.509 인증서와 Token Exchange Role로 보안을 강화한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.