Warp Decode를 활용한 MoE 추론 가속화
·2026.04.08 09:00
Warp Decode는 Blackwell GPU에서 MoE 추론의 병렬화 축을 전문가에서 출력값으로 전환해 성능을 1.84배 높였다.
기존 MoE(Mixture of Experts) 추론 시스템은 전문가(Expert)를 중심으로 연산을 구성한다. 이는 대규모 배치나 프리필(Prefill) 단계에서는 효율적이지만, 한 번에 하나의 토큰만 생성하는 Autoregressive Decode 단계에서는 데이터 레이아웃 관리를 위한 불필요한 오버헤드가 발생한다.
Warp Decode는 병렬화의 축을 전문가가 아닌 출력값(Neuron)으로 완전히 뒤집는다. 각 Warp를 단일 출력값 계산에 할당하여, 데이터 스테이징이나 워프 간 동기화, 중간 버퍼 없이 메모리에서 직접 가중치를 스트리밍하고 결과를 집계한다.
이 방식은 연산 과정을 두 개의 핵심 커널로 압축한다:
- Gate/Up 커널: 각 워프가 중간 뉴런을 소유하며, MXFP8 가중치를 FP32로 즉시 변환해 연산한다. 활성화 벡터를 한 번만 읽어 두 프로젝션에 재사용함으로써 효율을 높였다.
- Down 커널:
__shfl_xor_sync를 이용한 Butterfly Reduction을 통해 공유 메모리를 거치지 않고 레지스터 수준에서 결과를 통합한다.
Blackwell GPU 환경에서 Warp Decode는 1.84배의 처리량(Throughput) 향상을 달성했다. 또한, 출력값이 FP32 참조값에 1.4배 더 가까워지며 연산 정확도까지 동시에 개선하는 성과를 거두었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.