AI Briefing

에이전트 시대를 위한 두 개의 칩: Google의 8세대 TPU

·2026.04.23 10:00

핵심 내용

Google이 훈련용 TPU 8t와 추론용 TPU 8i를 공개했다.

자세히 보기

Google이 8세대 TPU를 훈련용 TPU 8t와 추론용 TPU 8i로 분리해 발표했다. 에이전트형 워크로드의 요구가 달라졌다고 보고, 학습과 서빙을 각각 다른 아키텍처로 최적화했다.

TPU 8t는 대규모 훈련에 초점을 맞춘다.

  • 단일 슈퍼팟이 9,600칩과 121 ExaFlops까지 확장된다.
  • 이전 세대 대비 Pod당 컴퓨팅 성능이 약 3배 향상됐다.
  • TPUDirect, 10배 빠른 스토리지 접근, Virgo Network와 JAX/Pathways 조합으로 대규모 확장과 근선형 스케일링을 노린다.
  • 목표 goodput은 97% 이상이며, 텔레메트리, 자동 우회 라우팅, OCS 같은 RAS 기능을 포함한다.

TPU 8i는 지연 민감한 추론과 에이전트 실행에 맞췄다.

  • 288GB HBM과 384MB 온칩 SRAM으로 메모리 병목을 줄였다.
  • Axion ARM 기반 CPU 호스트와 NUMA 격리를 적용했다.
  • MoE 모델을 위해 ICI 대역폭을 19.2 Tb/s로 확대했고, Boardfly 토폴로지로 네트워크 직경을 줄였다.
  • 온칩 CAE로 글로벌 연산 지연을 최대 5배 낮췄고, 달러당 성능은 80% 개선됐다.

두 칩 모두 Google 자체 Axion 호스트, 4세대 액체 냉각, 통합 전력 관리와 결합돼 시스템 단위 효율을 끌어올린다. Google은 올해 하반기 일반 제공을 예고했고, AI Hypercomputer의 일부로 제공할 예정이다. 네이티브로 JAX, MaxText, PyTorch, SGLang, vLLM을 지원하며, 베어메탈 접근도 제공한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.