AI 칩 아키텍처의 '새로운 황금기': GPU, TPU, LPU 등 도메인 특화 하드웨어의 진화와 메모리 벽 해결 전략
핵심 내용
무어의 법칙 종말 이후 AI 연산 수요 급증으로 GPU, TPU, LPU 등 도메인 특화 아키텍처가 폭발적으로 증가하며 메모리 병목 현상을 해결하기 위한 다양한 기술적 접근법이 제시되고 있다.
자세히 보기
무어의 법칙과 데나드 스케일링의 한계로 단일 스레드 CPU 성능 성장률이 연 52%에서 3%로 급감하면서, AI 연산을 위한 **도메인 특화 아키텍처(DSA)**의 필요성이 대두되었다. Hennessy와 Patterson이 예측한 '컴퓨터 아키텍처의 새로운 황금기'는 현실이 되어 GPU, TPU, LPU, NPU, 웨이퍼 스케일 엔진 등 수십 가지의 새로운 아키텍처가 개발 및 배포되고 있다.
AI 연산의 본질과 메모리 벽
AI 연산은 행렬 곱셈(GEMM)과 벡터 곱(GEMV)으로 지배된다. 학습과 프리필(Prefill) 단계에서는 높은 산술 강도를 가진 GEMM 연산이 주로 수행되지만, 디코딩(Decode) 단계에서는 토큰 단위로 처리되어 산술 강도가 급격히 떨어지는 GEMV 연산이 주를 이룬다. 이때 연산 속도 대비 메모리 대역폭의 부족으로 발생하는 **메모리 벽(Memory Wall)**이 핵심 병목 현상이다. 각 아키텍처는 데이터의 위치, 이동 방식, 연산 유닛 구조, 칩 간 통신 방식을 통해 이 데이터 이동 문제를 해결하려 한다.
주요 아키텍처와 시장 동향
현재 실제 배포에 성공한 주요 아키텍처와 그 특징은 다음과 같다.
- NVIDIA GPU: CUDA 생태계와 프로그래밍 가능성을 바탕으로 가장 강력한 선두 주자다. OpenAI와 Meta로부터 총 6GW 규모의 공급 계약을 확보했다.
- TPU (Google): 시스톨릭 어레이 기반 가속기로 Gemini 학습에 사용되며, Anthropic에 최대 100만 개 칩을 제공할 예정이다.
- Trainium (AWS): Anthropic이 Claude 모델 구동에 100만 개 이상의 칩을 사용 중이다.
- Cerebras Wafer-Scale Engine: OpenAI의 추론 서비스에 활용되고 있다.
- Groq LPU: NVIDIA가 200억 달러 규모의 인수를 통해 흡수하며 NVIDIA 생태계로 편입되었다.
이러한 하드웨어 경쟁은 단순한 연산 성능을 넘어, 메모리 대역폭 최적화와 대규모 스케일링(scale-up/out) 전략이 AI 인프라의 핵심 경쟁력으로 부상했음을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.