Micron, Hot Chips서 메모리 병목 해결책 제시… Samsung PIM으로 LLM 추론 3배 빨라져
Micron's memory wall chart. Compute up ~3x every two years, HBM bandwidth under 2x
·2026.09.14 11:56
핵심 내용
Micron이 Hot Chips 2026에서 연산과 메모리 대역폭의 격차를 분석하고, Samsung의 LPDDR5X PIM 기술로 Llama 3.1 8B 추론 속도가 3.01배 향상된 사례를 공개했다.
자세히 보기
Micron은 Hot Chips 2026에서 Raghu Sreeramaneni의 메모리 튜토리얼을 통해 연산 성능과 메모리 대역폭 사이의 격차를 시각화했다. TPU v3부터 R200까지의 정규화된 TFLOPS는 2년마다 약 3배씩 증가한 반면, HBM2e에서 HBM4까지의 대역폭은 2배 미만으로 증가해 두 지표 간 차이가 크게 벌어졌다.
이러한 '메모리 월(Memory Wall)' 문제를 해결하기 위해 업계가 실제로 구축 중인 세 가지 접근 방식이 소개되었다:
- 연산 옆 메모리 배치: 물리적 거리를 줄이는 방식
- 짧은 링크를 통한 근접 배치: 연결 지연을 최소화하는 방식
- 메모리 내부 연산(PIM): 데이터 이동 없이 메모리 내에서 직접 계산하는 방식
특히 PIM 기술의 경우, Samsung이 LPDDR5X에 이를 적용하여 Llama 3.1 8B 모델 추론 시 초당 토큰 생성 속도가 3.01배 향상되었음을 측정 결과로 제시했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.