Arm, C2-Ultra CPU와 G2-Ultra NX GPU 공개…성능 개선은 클럭·캐시 효과 포함
핵심 내용
Arm이 C2-Ultra CPU와 G2-Ultra NX GPU를 공개했으나, 성능 향상분 중 상당 부분은 클럭 상승과 캐시 확대에 기인한 것으로 분석됐다.
자세히 보기
Arm이 데이터센터용 Neoverse CSS N4 IP와 함께 플래그십 모바일용 C2-Ultra CPU, 그리고 G2-Ultra NX GPU를 공개했다. G2-Ultra NX는 Xiaomi의 XRING O3 칩에 탑재되어 8월 24일 출시될 예정이다.
C2-Ultra CPU: 제한적인 아키텍처 변경
C2-Ultra는 이전 세대인 C1-Ultra 대비 최대 IPC(클럭당 명령어 수) 7%, 피크 성능 15%, 평균 워크로드 성능 12% 향상을 주장한다. 그러나 이러한 수치는 클럭 속도 8.5% 상승과 L2 캐시 3MB 추가 효과가 포함된 결과다. 클럭 증가분을 제외하면 평균 성능 향상은 3.2% 수준으로, 순수 마이크로아키텍처 개선 폭은 제한적이라는 평가다.
아키텍처 측면에서 C2-Ultra는 2세대 전 코어인 Cortex X925와 동일한 디코더 및 실행 유닛 구성을 유지하며, 분기 예측기(branch predictor)와 오더 아웃 오브 실행 버퍼 등 일부 구조만 반복적으로 개선되었다. 전력 효율은 38% 개선되었으나, 이는 공정 노드 및 구현 방식의 개선 효과가 포함되어 순수 아키텍처 기여도는 불분명하다.
G2-Ultra NX GPU: 매트릭스 가속기 도입
G2-Ultra NX는 Arm이 '7세대 만의 가장 큰 GPU 재설계'라고 표현한 제품으로, 셰이더 코어 사양(128 FMA 유닛)은 유지하되 매트릭스 가속기를 내장했다. 이는 INT8 기준 1,024 MACs/clock을 처리할 수 있으며, 레이 트레이싱 유닛 최적화를 통해 DRAM 트래픽을 13% 줄였다. 또한 ML 기반 업스케일링 기술인 **Neural Super Sampling (NSS)**을 도입했다.
Xiaomi XRING O3에서는 셰이더 코어의 절반만 매트릭스 가속기를 구현했으며, 이는 코어 면적을 약 21% 증가시킨다. Arm은 전 세대 대비 게임 성능 14%, 레이 트레이싱 벤치마크 24% 향상을 주장하지만, 클럭이 약 11% 높아진 점을 고려하면 비-레이 트레이싱 게임에서의 실질적 성능 개선은 미미할 수 있다.
Neoverse CSS N4 및 평가
서버용 Neoverse CSS N4는 다이당 8~128개의 코어를 지원하며, 최대 주파수 3.8 GHz, DDR5/LPDDR6 메모리, PCIe Gen 6/7 및 CXL 4.0을 지원한다. 다만 Arm의 이번 발표 자료는 핵심 기술 세부 사항이 부족해 질문을 통해 정보를 얻어야 하는 수준이었다는 비판을 받고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.