AMD MI300X LLM 추론 최적화 기술
Building a monokernel for LLM inference on AMD MI300X - up to 3,300 output tokens/s per request [P]
·2026.05.29 17:54
핵심 내용
AMD MI300X에서 요청당 최대 3,300 tokens/s를 달성하는 LLM 추론용 모노커널 기술이 공개되었다.
자세히 보기
AMD MI300X의 다이 토폴로지(die topology)를 활용해 메모리 액세스 패턴을 물리적 레이아웃에 매핑하고, 연산 유닛을 IOD(I/O Die)와 그룹화하는 모노커널(monokernel) 기술을 개발했다.
8개의 MI300X를 사용한 테스트 결과, 배치 사이즈 1, 투기적 디코딩(speculative decoding) 및 양자화 없이 2B 코딩 모델에서 요청당 최대 3,300 tokens/s의 출력 속도를 달성했다.
하드웨어의 설계 성능을 최대한 활용하도록 설계되었으며, 향후 대규모 MoE(Mixture of Experts) 모델 지원을 목표로 하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.