와트당 최대 30배의 작업 처리: NVIDIA Vera Rubin NVL72, AI 에이전트 효율성 신기록 달성
핵심 내용
NVIDIA Vera Rubin NVL72가 AI 에이전트 워크로드에서 기존 대비 30배 높은 처리량과 35배 낮은 토큰 비용을 달성했다.
자세히 보기
AI 에이전트 워크로드는 단순 채팅 요청보다 15배 많은 토큰을 소비한다. 에이전트가 금융 데이터베이스 조회, 뉴스 검색, 서브 에이전트 호출 등을 반복하며 컨텍스트가 누적되기 때문이다. 이러한 긴 컨텍스트 처리는 AI 인프라의 효율성을 결정짓는 핵심 요소가 되었다.
NVIDIA는 Vera Rubin NVL72 시스템이 에이전트 워크로드에서 GB300 NVL72 대비 와트당 최대 30배 높은 처리량을 제공한다고 밝혔다. 이는 실제 코딩 세션을 기록한 SemiAnalysis AgentX 워크로드를 통해 측정된 결과다. 전력 제약이 있는 AI 팩토리에서는 동일한 에너지 소비로 30배 더 많은 에이전트 작업을 수행할 수 있음을 의미한다.
Vera Rubin NVL72는 토큰당 비용도 GB300 NVL72 대비 최대 35배 낮다. 이는 대규모로 에이전트를 지속적으로 실행할 때 수익성을 크게 개선한다. NVIDIA는 DSX MaxLPS 기술을 통해 GPU, 랙, 워크로드 레벨의 전력을 관리하여 동일한 메가와트 예산 내에서 최대 40% 더 많은 GPU를 프로비저닝할 수 있다고 설명했다.
이러한 성능 향상은 플랫폼 전체에 걸친 극단적인 코드 디자인(Extreme Codesign) 덕분이다. 주요 최적화 기술은 다음과 같다.
- 분리형 서빙(Disaggregated serving): 컨텍스트 처리(프리필)와 응답 생성(디코드)를 분리해 독립적으로 스케일링
- 레이트 매칭(Rate matching): 프리필 및 디코드 GPU의 토큰 생성 속도를 동기화하여 효율 극대화
- 대규모 전문가 병렬화(Large-scale expert parallelism): MoE 모델의 전문가 서브네트워크를 GPU 도메인에 분산 배치
- 분산 KV 캐싱(Distributed KV-caching): GPU 도메인 내 메모리를 확장하고 비활성 컨텍스트를 호스트/스토리지로 오프로딩
- KV 인식 라우팅(KV-aware routing): 관련 캐시 컨텍스트를 이미 보유한 GPU로 요청을 라우팅하여 중복 계산 방지
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.