AI Briefing

NVIDIA의 추론 소프트웨어 스택이 토큰 비용을 낮추는 방법

·2026.07.01 00:00

NVIDIA는 Blackwell 플랫폼과 최적화된 소프트웨어 스택을 통해 AI 추론 시 토큰당 비용을 획기적으로 낮추고 있다.

기업들이 AI 파일럿 단계를 넘어 실제 생산 단계로 진입함에 따라, 인프라 결정 기준이 단순한 칩 사양에서 **토큰당 비용(Cost per Token)**으로 이동하고 있습니다. 이는 달러, 전력, 지연 시간(Latency) 대비 얼마나 많은 유용한 토큰을 제공할 수 있는지를 의미합니다.

NVIDIA의 풀스택 추론 소프트웨어는 GPU, CPU, 네트워킹 및 시스템과 공동 설계되어 하드웨어 성능을 지속적으로 개선합니다. 특히 NVIDIA Blackwell 플랫폼에서는 소프트웨어 스택을 통해 DeepSeek V4 모델의 토큰 비용을 단 한 달 만에 최대 5배까지 절감했습니다.

주요 기업들의 도입 사례는 다음과 같습니다:

  • Baseten: TensorRT-LLM을 사용하여 DeepSeek V4 Pro의 초당 토큰 생성량을 최대 50% 향상.
  • Cognition: NVIDIA Dynamo 프레임워크를 통해 인프라 구축 없이 강화 학습 워크로드 확장.
  • Deep Infra: Blackwell 기반으로 DeepSeek V4를 포함한 최신 오픈 소스 모델을 즉시 서비스.
  • Together AI: TensorRT-LLM을 활용해 Cursor의 실시간 코딩 경험을 위한 모델 최적화 가속화.

기존의 웹/SaaS 워크로드는 예측 가능한 패턴을 가졌으나, Agentic AI는 다릅니다. 에이전트는 추론, 계획, 도구 호출, 하위 에이전트 생성 등을 수행하며 데이터 센터 전반에 걸쳐 분산된 상태 유지(Stateful) 워크플로우를 실행해야 하므로 새로운 경제적 접근 방식이 필요합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.