Amazon EKS에서 NVIDIA OSMO 기반 Physical AI 워크플로 운영하기
·2026.06.05 15:26
Amazon EKS에서 NVIDIA OSMO를 활용해 Physical AI 워크플로를 효율적으로 운영하는 레퍼런스 아키텍처를 소개한다.
Physical AI 모델 개발은 데이터 수집, 시뮬레이션, 정책 학습, 엣지 배포가 반복되는 긴 라이프사이클을 가진다. 반복적인 워크플로를 안정적으로 실행하려면 실행 환경, 아티팩트 보존, 관찰 가능성, 보안, 버전 호환성을 일관되게 관리해야 한다.
이 아키텍처는 NVIDIA OSMO를 외부 의존성으로 유지하면서 Amazon EKS 위에서 Physical AI 워크로드를 안전하고 효율적으로 운영하기 위한 레퍼런스 모델을 제시한다.
주요 구성 요소는 다음과 같다:
- 기반 인프라: Amazon EKS를 컨트롤 플레인으로 사용하며, Amazon RDS, S3, ECR, Secrets Manager 등 AWS 관리형 서비스를 통해 메타데이터와 아티팩트를 안전하게 보존한다. 관찰성은 Amazon Managed Service for Prometheus와 Grafana를 통해 확보한다.
- GPU 실행 환경: Karpenter를 통해 Amazon EC2 G family GPU 인스턴스의 용량을 관리하고, NVIDIA GPU Operator와 **Elastic Fabric Adapter(EFA)**로 리소스 노출 및 네트워크 가속을 제공한다.
- 워크플로 실행: KAI Scheduler가 PodGroup CRD와 gang scheduling을 처리하며, NVIDIA OSMO가 전체 오케스트레이션과 메타데이터 관리를 담당한다.
배포는 Terraform, Helm, kubectl을 사용하여 인프라와 구성 요소를 단계별로 설치할 수 있도록 설계되었다. 보안을 위해 모든 구성 요소는 프라이빗 네트워크 내에서 운영되며, 데이터와 볼륨은 암호화되어 관리된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.