카카오, VMware 인프라 최적 VM 밀도 검증 연구 공개
핵심 내용
카카오가 Intel Xeon 프로세서 기반 VMware 인프라의 최적 VM 밀도를 검증했다.
자세히 보기
카카오가 VMware 인프라의 최적 VM 밀도를 결정하기 위해 CPU 성능에 초점을 맞춘 포괄적인 테스트를 진행했다. 목표는 7% 또는 20%와 같은 정의된 성능 저하 임계값을 초과하지 않으면서 단일 물리 서버(PM)가 호스팅할 수 있는 최대 가상 머신 수를 파악하는 것이었다.
테스트 방법론
팀 **Sapphire Rapids (4410Y)**와 Cascade Lake (4214) 두 종류의 Intel Xeon Silver 프로세서에서 2, 4, 8 vCPU의 세 가지 VM 플레버를 테스트했다. VM CPU 사용률은 10%에서 100%까지 10% 단위로 조절했으며, VM 수는 1대에서 60대까지 늘렸다. 성능 측정과 CPU 성능 카운터 수집을 위해 CoreMark와 stress-ng 벤치마크를 실행했다.
성능 저하 요인
분석 결과 성능 저하는 선형 감소가 아닌 1/N 패턴을 따르는 것으로 나타났다. 이를 주도하는 두 가지 주요 요인은 다음과 같다:
- 명령어당 사이클 (IPC): VM 수가 증가하면 CPU 사이클이 포화되기 전에도 Cache Misses 증가로 인해 IPC가 하락한다.
- CPU 사이클: PM의 물리 코드가 포화되면 VM당 가용 CPU 사이클이 줄어들어 성능이 추가로 저하된다.
Turbo Boost는 CPU 사이클을 약 35% 증가시키면서 IPC를 약간 감소시켜 순 성능 향상을 가져왔다. 또한 벤더 간 차이가 관찰되었는데, 동일한 CPU 모델을 사용했음에도 한 하드웨어 벤더는 Cache Miss 비율이 60%까지 치솟는 반면 다른 벤더는 40%를 기록했다.
실무적 시사점
이 연구는 용량 계획 프레임워크를 제공한다. 예를 들어, 평균 CPU 사용률 40%인 4 vCPU VM을 사용하는 Cascade Lake PM에서 최대 20%의 성능 손실을 허용할 경우 호스트당 약 21대의 VM을 배치할 수 있다. 저자들은 이러한 결과가 CPU 제약에 특화되었지만, 방법론은 메모리와 디스크 자원으로 확장하여 인프라 전체를 최적화하는 데 적용할 수 있다고 언급했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.