AMD MI300X에서 DeepSeek-V4-Flash 구동하기
·2026.06.03 02:52
AMD MI300X에서 DeepSeek-V4-Flash를 구동할 때 발생하는 FP8 표준 불일치 및 커널 최적화 문제를 분석한다.
AMD MI300X는 NVIDIA H100 대비 높은 HBM3 용량과 저렴한 가격을 갖췄지만, 소프트웨어 생태계의 한계로 인해 특정 모델 구동에 기술적 난관이 존재한다.
FP8 데이터 타입 불일치 MI300X는 AMD/Graphcore가 제안한 fnuz 방식을 사용하는 반면, 최신 칩과 vLLM은 OCP 표준을 따른다. 두 방식은 비트 레이아웃은 유사하지만 지수 편향(exponent bias)이 1만큼 달라, 잘못된 다이얼렉트를 사용할 경우 값이 정확히 2배 차이 나는 문제가 발생한다. 이는 MI300X에서 실질적으로 발생하는 주요 이슈다.
Attention 커널 최적화 부재 DeepSeek-V4의 Sparse Attention을 효율적으로 처리하기 위해서는 AMD의 튜닝 커널 라이브러리인 AITER의 지원이 필수적이다. 그러나 AITER의 지원 범위가 MI300X(gfx942) 아키텍처에는 불충분하다.
- 누락된 경로: paged MQA logits, sparse MLA prefill, sparse MLA decode 등의 경로가 gfx942용 AITER에서 누락되어 있다.
- 오작동 문제: 일부 AITER 경로가 MI300X에서 정상적으로 작동하지 않는다.
이를 해결하기 위해 AITER 지원 여부에 따라 Triton 구현으로 폴백하거나, ROCm 전용 헬퍼를 직접 구현하여 최적화된 커널을 호출하는 방식이 요구된다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.