AI Briefing

NHN Cloud, AI 학습과 GPU 운영 통합 솔루션 'GPU Live' 공개

·2026.10.08 09:23

핵심 내용

온프레미스와 클라우드 모두 설치 가능한 멀티테넌트 올인원 솔루션으로 동적 할당과 자동 회수를 지원한다.

1 / 7

자세히 보기

NHN Cloud가 AI 학습 실행과 GPU 자원 운영을 하나의 콘솔에서 처리하는 설치형 멀티테넌트 올인원 솔루션 GPU Live를 공개했다. 이 솔루션은 온프레미스와 클라우드 환경 모두에 설치할 수 있으며, 공공 및 금융 기관의 망분리 요구사항과 기업 내 다수 팀의 GPU 공유 필요성을 동시에 충족하도록 설계되었다.

자원 효율성을 높이는 동적 할당 기술

GPU Live는 Kubernetes 표준 인터페이스를 기반으로 GPU를 단일 풀로 관리하며, 워크로드 발생 시 온디맨드로 자원을 배정하고 종료 시 즉시 회수하는 동적 할당 방식을 채택했다. 특히 빈패킹(Bin Packing) 정책을 적용해 신규 워크로드를 이미 사용 중인 노드에 우선 배치함으로써, 분산 학습에 필요한 빈 노드를 확보한다. 또한 **갱 스케줄링(Gang Scheduling)**을 통해 분산 학습 인스턴스가 모두 준비되었을 때만 일괄 실행하여 부분 시작으로 인한 자원 낭비를 차단한다. GPU 사용률이 임곗값 이하인 워크로드는 자동으로 회수되어 다른 작업에 재배정된다.

학습 워크로드의 End-to-End 자동화

사용자는 컨테이너 이미지, GPU 자원, 실행 방식을 묶은 워크로드만 정의하면 인프라 할당부터 결과 저장, 자원 반환까지 전체 라이프사이클이 자동으로 처리된다. 단일 또는 분산 노드 구성과 인터랙티브(Jupyter/SSH) 또는 배치 실행 방식을 조합할 수 있다. 학습 실패 시 최대 3회까지 자동 재실행되는 기능을 제공하며, Web SFTP를 통해 대용량 학습 데이터를 쉽게 업로드하고 다운로드할 수 있다.

멀티테넌트 환경의 통제와 가시성

시스템, 조직, 프로젝트의 3계층 구조로 자원 쿼터와 권한을 격리하며, SuperAdmin부터 Project Viewer까지 6단계의 역할 기반 접근 제어(RBAC)를 지원한다. 모든 변경 사항은 수정이 불가능한 감사 로그로 자동 기록되며, 탈퇴한 사용자의 개인정보는 자동 마스킹 처리된다. NVIDIA DCGM 기반의 실시간 모니터링과 5분 주기 미터링 데이터를 제공해 과금 근거 및 내부 정산 자료로 활용할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.