NVIDIA, AI 팩토리 효율성 강조… Vera Rubin과 DSX로 '토큰/와트' 최적화
핵심 내용
NVIDIA가 AI Infra Summit에서 Vera Rubin과 DSX 플랫폼을 소개하며, AI 팩토리의 핵심 지표가 '검증된 에이전틱 토큰/메가와트'로 이동하고 있음을 강조했습니다. 파트너사 Lambda는 DSX MaxLPS를 통해 전력당 성능을 23% 개선했습니다.
자세히 보기
NVIDIA는 AI Infra Summit에서 Vera Rubin 시스템과 DSX 플랫폼을 중심으로 한 풀스택 AI 팩토리 전략을 공개하며, 인프라의 핵심 지표가 피크 성능에서 **검증된 에이전틱 토큰/메가와트(validated agentic tokens per megawatt)**로 변화하고 있음을 강조했습니다. 이를 위해 실리콘부터 그리드까지의 코드사인이 필수적이며, DSX MaxLPS를 통해 팩토리 전체의 전력 최적화를 달성할 수 있다고 설명했습니다.
DSX MaxLPS와 전력 최적화
DSX MaxLPS는 GPU와 랙의 전력 소비를 실시간으로 모니터링하고 동적으로 재배분하여 정적 할당으로 인한 미사용 용량을 회수합니다. AI 클라우드 제공업체 Lambda는 NVIDIA Blackwell 서버 기반의 첫 검증 결과를 공개했는데, 16개 풀파워 노드 예산 내에서 19개 노드를 실행할 수 있었으며, 클러스터 전체 토큰 처리량은 24% 증가(초당 약 400만->500만 토큰)했고 성능/와트는 23% 개선되었습니다. 차세대 Vera Rubin NVL72 AI 팩토리는 올바른 배포 환경에서 동일 메가와트 예산 내 최대 40% 더 많은 GPU 용량을 확보할 수 있습니다.
에이전틱 AI 성능과 벤치마크
NVIDIA Groq 3 LPX는 에이전틱 AI의 지연 시간과 컨텍스트 길이 문제를 해결하기 위해 Vera Rubin에 결정적(deterministic) 초저지연 추론을 추가했습니다. SemiAnalysis AgentX 벤치마크 기준, Vera Rubin NVL72는 GB300 NVL72 대비 DeepSeek V4 Pro 모델에서 메가와트당 최대 30배 높은 처리량을 기록했으며, 토큰 비용은 최대 45배 낮아졌습니다. 이는 전력 제약 환경에서 AI 팩토리의 수익 창출 능력과 마진을 결정짓는 핵심 요소입니다.
그리드 유연성과 파트너십
Emerald AI는 NVIDIA DSX Flex를 활용해 그리드 신호에 따라 AI 워크로드 전력을 자동으로 조절하는 유연 부하 프로그램을 시연했습니다. Emerald AI와 NVIDIA는 Silicon Valley Power와 협력하여 수백 개의 수요 신호에 성공적으로 대응하며 AI 워크로드 성능을 보호하는 자동 부하 감소를 시연했습니다. 또한 Amazon Annapurna Labs는 NVIDIA와 NVHBM 커스텀 고대역폭 메모리 기술을 공동 개발 중이며, d-Matrix는 NVLink Fusion 플랫폼을 자사 Raptor XPUs에 통합합니다.
Vera CPU와 NVLink 6
NVIDIA Vera CPU는 에이전트 워크로드와 데이터 집약적 작업에서 뛰어난 성능을 보였습니다. Perplexity는 샌드박스 시작 속도가 1.9배 향상되었고, Redpanda는 지연이 5.5배 감소하고 처리량이 73% 증가했다고 밝혔습니다. NVLink 6는 대규모 AI 팩토리 환경의 신뢰성을 위해 다층적 복원력 아키텍처를 적용하여, 물리적 계층의 전방 오류 정정(FEC)과 네트워크 계층의 신용 기반 흐름 제어를 통해 장애를 지역적으로 격리합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.