AI Briefing

AMD MI300X LLM 추론 최적화 기술

Building a monokernel for LLM inference on AMD MI300X - up to 3,300 output tokens/s per request [P]

·2026.05.29 17:54

AMD MI300X에서 요청당 최대 3,300 tokens/s를 달성하는 LLM 추론용 모노커널 기술이 공개되었다.

AMD MI300X의 다이 토폴로지(die topology)를 활용해 메모리 액세스 패턴을 물리적 레이아웃에 매핑하고, 연산 유닛을 IOD(I/O Die)와 그룹화하는 모노커널(monokernel) 기술을 개발했다.

8개의 MI300X를 사용한 테스트 결과, 배치 사이즈 1, 투기적 디코딩(speculative decoding) 및 양자화 없이 2B 코딩 모델에서 요청당 최대 3,300 tokens/s의 출력 속도를 달성했다.

하드웨어의 설계 성능을 최대한 활용하도록 설계되었으며, 향후 대규모 MoE(Mixture of Experts) 모델 지원을 목표로 하고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.