AI TCO를 다시 생각하다: 왜 토큰당 비용이 유일한 지표인가
핵심 내용
AI 인프라의 진짜 성과는 FLOPS가 아니라 토큰당 비용으로 결정된다.
자세히 보기
전통적인 데이터센터는 데이터를 저장하고 처리하는 데 머물렀지만, 생성형·에이전틱 AI 시대에는 AI token factory로 바뀌었다. 이제 인프라의 경제성은 GPU 사양이나 FLOPS per dollar가 아니라, 실제로 한 토큰을 만들어내는 데 드는 cost per token으로 평가해야 한다.
핵심은 계산식의 분자보다 분모다. GPU 시간당 비용은 눈에 잘 보이는 입력값이지만, 기업이 실제로 확보하는 가치는 tokens per second와 이를 높이는 소프트웨어·네트워크·메모리·스토리지·에코시스템 최적화가 결정한다. 더 많은 토큰을 더 적은 전력과 더 높은 활용도로 뽑아낼수록 cost per million tokens는 내려가고, 같은 인프라에서 얻는 수익성은 커진다.
이 글은 이를 **"inference iceberg"**로 설명한다. 표면에는 cost per GPU per hour, peak PFLOPS, HBM capacity, FLOPS per dollar 같은 지표가 보이지만, 수면 아래에는 실제 토큰 출력에 영향을 주는 요소가 있다.
- MoE 모델의 all-to-all 트래픽을 감당하는 scale-up interconnect
- FP4 지원과 정확도 유지
- speculative decoding, multi-token prediction 같은 지연시간 절감 기법
- disaggregated serving, KV-aware routing, KV-cache offloading
- agentic AI의 초저지연, 고처리량, 긴 입력 시퀀스 대응
- training부터 post-training, 대규모 inference까지 이어지는 전체 수명주기 지원
DeepSeek-R1 사례도 같은 결론을 보여준다. NVIDIA의 Blackwell은 Hopper 대비 compute cost는 약 2배 비싸지만, 실제로는 tokens per watt 50배 이상, cost per million tokens 35배 낮음을 보인다. 표면 지표로는 설명되지 않는 이 격차가, 인프라 선택의 기준을 출력 중심으로 바꿔야 하는 이유다.
마지막 결론은 분명하다. AI 인프라를 고를 때는 사양 비교보다 토큰당 비용과 실제 토큰 출력을 봐야 한다. NVIDIA는 하드웨어, 소프트웨어, 파트너 생태계를 함께 최적화한 extreme codesign으로 토큰 비용을 낮추고, 기존 인프라에서도 오픈소스 inference stack의 개선을 통해 시간이 갈수록 효율을 더 끌어올린다고 주장한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.