AI Briefing

에이전트 시대를 위한 두 개의 칩, 우리의 8세대 TPU

·2026.04.22 21:15

핵심 내용

Google이 훈련용 TPU 8t와 추론용 TPU 8i를 공개했다.

1 / 2

자세히 보기

Google Cloud Next에서 8세대 TPU를 공개했다. 이번 세대는 훈련용 TPU 8t와 추론용 TPU 8i로 나뉘며, 모델 학습·배포·에이전트 워크로드를 각각 겨냥한다.

TPU 8t는 대규모 훈련용으로 설계됐다.

  • 이전 세대 대비 pod당 compute 성능 약 3배
  • 한 개 superpod에서 9,600 chips, 2PB shared HBM, 2배 interchip bandwidth
  • 121 ExaFlops의 compute
  • TPUDirect와 10배 빠른 storage access로 utilization 향상
  • Virgo Network, JAX, Pathways와 결합해 최대 100만 chips의 논리적 클러스터까지 near-linear scaling을 지향
  • 자동 링크 우회, OCS, 실시간 telemetry 등으로 97% 이상 goodput 목표

TPU 8i는 지연에 민감한 추론과 에이전트 실행용이다.

  • 288GB HBM와 384MB on-chip SRAM으로 working set을 온칩에 유지
  • Axion ARM 기반 CPU 호스트를 사용해 시스템 효율을 최적화
  • ICI bandwidth 19.2 Tb/s, Boardfly 아키텍처로 네트워크 지연 감소
  • CAE가 global operations를 오프로드해 on-chip latency를 최대 5배 줄임
  • 이전 세대 대비 performance-per-dollar 80% 개선을 주장

두 칩은 모두 JAX, MaxText, PyTorch, SGLang, vLLM을 지원하고, bare metal access도 제공한다. Google은 이를 AI Hypercomputer의 일부로 묶어, compute·storage·networking·software를 통합한 에이전트 시대용 인프라로 포지셔닝했다. 두 칩 모두 올해 말 일반 공급될 예정이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.