Google Cloud C4, GPT OSS TCO 70% 개선
Google Cloud C4 Brings a 70% TCO improvement on GPT OSS with Intel and Hugging Face
·2025.10.16 09:00
Intel Xeon 6 기반 Google Cloud C4 VM이 GPT OSS 추론 시 TCO를 1.7배 개선했다.
Intel과 Hugging Face의 협업을 통해 Google Cloud의 최신 C4 VM(Intel Xeon 6 프로세서 탑재) 성능을 벤치마킹한 결과, 이전 세대인 C3 VM 대비 TCO(총 소유 비용)가 1.7배 개선된 것으로 나타났다.
주요 성과는 다음과 같다:
- vCPU당 TPOT(Time Per Output Token) 처리량 1.4~1.7배 향상
- C3 VM 대비 시간당 비용 감소
이번 성능 향상은 Hugging Face transformers 라이브러리에 병합된 MoE(Mixture of Experts) 전문가 실행 최적화 덕분이다. 이 최적화는 모든 전문가가 모든 토큰을 처리하던 기존 방식에서 벗어나, 각 전문가가 할당된 토큰만 처리하도록 유도하여 연산(FLOPs) 낭비를 줄이고 활용도를 높였다.
벤치마크에는 OpenAI의 오픈소스 MoE 모델인 GPT OSS가 사용되었으며, Intel Xeon 6(Granite Rapids) 아키텍처를 통해 대규모 모델의 CPU 추론 효율성을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.