AI Briefing

GCP 5세대 Xeon, CPU 기반 AI 에이전트 가능성

Benchmarking Language Model Performance on 5th Gen Xeon at GCP

·2024.12.17 09:00

GCP의 5세대 Xeon(C4) 인스턴스가 이전 세대 대비 텍스트 임베딩 및 생성 성능에서 압도적인 효율성을 입증했다.

Google Cloud의 **C4 인스턴스(5세대 Intel Xeon, AMX 지원)**와 **N2 인스턴스(3세대 Intel Xeon)**를 대상으로 에이전틱 AI(Agentic AI)의 핵심 구성 요소인 텍스트 임베딩과 텍스트 생성 성능을 비교 분석했다.

주요 벤치마크 결과는 다음과 같다:

  • 텍스트 임베딩 (UAE-Large-V1): C4 인스턴스가 N2 대비 **10배~24배 높은 처리량(Throughput)**을 기록했으며, TCO(총 소유 비용) 측면에서도 7배~19배의 이점을 보였다.
  • 텍스트 생성 (Llama-3.2-3B): C4 인스턴스가 N2 대비 2.3배~3.6배 높은 처리량을 기록했으며, TCO 측면에서 1.7배~2.9배의 이점을 보였다.

이번 결과는 Intel AMX(Advanced Matrix Extensions) 기술이 적용된 최신 CPU를 활용할 경우, 소형 언어 모델(SLM) 기반의 가벼운 에이전틱 AI 솔루션을 GPU 없이 CPU만으로도 충분히 효율적으로 배포할 수 있음을 시사한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.