AI Briefing

Triton 기반 교차 플랫폼 MoE 디스패치 공개

Cross-Platform Fused MoE Dispatch in Triton: Portable Expert Routing Without CUDA [R]

·2026.05.28 06:25

OpenAI Triton을 활용해 NVIDIA와 AMD 모두 지원하는 고성능 MoE 추론 커널을 개발했다.

OpenAI Triton으로 작성된 새로운 MoE(Mixture-of-Experts) 추론 커널인 TritonMoE가 공개되었습니다. 이 커널은 특정 벤더의 CUDA에 의존하지 않고 NVIDIA와 AMD GPU 모두에서 동작할 수 있는 높은 이식성을 제공합니다.

핵심 기술로는 Fused gate+up GEMM 방식이 도입되었습니다. 이는 SwiGLU 프로젝션을 공유 타일 로드에서 함께 계산하여 전역 메모리 트래픽을 35% 절감합니다.

성능 측면에서는 A100에서 Megablocks 대비 89~131%의 처리량을 보여주었으며, 동일한 커널을 수정 없이 AMD MI300X에서도 실행할 수 있습니다. 다만, 토큰 수가 2048개를 초과하거나 64개 이상의 전문가가 극심한 라우팅 불균형을 보일 경우 성능이 저하되는 특성이 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.