AI Briefing

삼성전자, Hot Chips 2026에서 LPDDR5X-PIM 공개… Llama 3.1 추론 속도 3배 향상

·2026.08.27 04:07

핵심 내용

삼성전자가 Hot Chips 2026에서 메모리 내부 연산(PIM) 기술을 적용한 LPDDR5X 패키지를 공개하며 Llama 3.1 추론 속도를 3배 개선했다.

자세히 보기

삼성전자가 Hot Chips 2026에서 LPDDR5X-PIM(Processing-in-Memory) 기술을 적용한 16GB 메모리 패키지를 공개했다. 이 기술은 DRAM 뱅크 내부에 연산 유닛을 배치하여 외부 인터페이스 병목을 해결하고, LLM 추론 시 필요한 대역폭을 극대화한다.

핵심 기술 및 성능

  • 내부 대역폭 혁신: 기존 LPDDR5X의 외부 핀 대역폭은 76.8 GB/s에 불과하지만, PIM 기술은 내부 뱅크를 활용해 614 GB/s의 내부 대역폭을 제공한다. 이는 Apple M5 Max의 전체 통합 메모리 대역폭과 유사한 수준이다.
  • 추론 속도 향상: Llama 3.1 8B 모델(320 토큰 컨텍스트)을 기준으로 측정했을 때, 일반 LPDDR5X 대비 실행 시간이 12.3초에서 5.4초로 단축되고, 처리량은 27 tok/s에서 81.3 tok/s로 약 3배 향상되었다.
  • 연산 정밀도: SINT4 가중치를 사용할 경우 패키지당 2.4 TOPS, FP8 사용 시 약 1.2 TFLOPS의 연산 성능을 달성한다.

호환성 및 적용 가능성

삼성전자는 기존 메모리 컨트롤러와의 호환성을 위해 Address Align Mode를 도입했다. 이를 통해 기존 DRAM 컨트롤러가 PIM 기능을 사용할 수 있으며, 단일 뱅크 모드(일반 DRAM)와 다중 뱅크 모드(PIM 연산) 간 전환이 가능하다. 이는 새로운 메모리 컨트롤러 개발 없이도 서버, 모바일, 클라이언트 기기 등에 PIM 기술을 도입할 수 있는 기반을 마련한다.

한계 및 시사점

해당 벤치마크는 단일 모델과 짧은 컨텍스트 길이를 기반으로 하며, KV 캐시 증가로 인한 대역폭 경쟁 문제는 고려되지 않았다. 하지만 GEMV(행렬-벡터 곱) 중심의 LLM 디코딩 단계에서 메모리 대역폭 병목을 실질적으로 해소할 수 있음을 실증했다는 점에서 AI 인프라 및 온디바이스 추론 최적화에 중요한 이정표가 될 전망이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.