Triton 기반 교차 플랫폼 MoE 디스패치 공개
Cross-Platform Fused MoE Dispatch in Triton: Portable Expert Routing Without CUDA [R]
·2026.05.28 06:25
핵심 내용
OpenAI Triton을 활용해 NVIDIA와 AMD 모두 지원하는 고성능 MoE 추론 커널을 개발했다.
자세히 보기
OpenAI Triton으로 작성된 새로운 MoE(Mixture-of-Experts) 추론 커널인 TritonMoE가 공개되었습니다. 이 커널은 특정 벤더의 CUDA에 의존하지 않고 NVIDIA와 AMD GPU 모두에서 동작할 수 있는 높은 이식성을 제공합니다.
핵심 기술로는 Fused gate+up GEMM 방식이 도입되었습니다. 이는 SwiGLU 프로젝션을 공유 타일 로드에서 함께 계산하여 전역 메모리 트래픽을 35% 절감합니다.
성능 측면에서는 A100에서 Megablocks 대비 89~131%의 처리량을 보여주었으며, 동일한 커널을 수정 없이 AMD MI300X에서도 실행할 수 있습니다. 다만, 토큰 수가 2048개를 초과하거나 64개 이상의 전문가가 극심한 라우팅 불균형을 보일 경우 성능이 저하되는 특성이 있습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.