AI Briefing

Triton 기반 교차 플랫폼 MoE 디스패치 공개

Cross-Platform Fused MoE Dispatch in Triton: Portable Expert Routing Without CUDA [R]

·2026.05.28 06:25

핵심 내용

OpenAI Triton을 활용해 NVIDIA와 AMD 모두 지원하는 고성능 MoE 추론 커널을 개발했다.

자세히 보기

OpenAI Triton으로 작성된 새로운 MoE(Mixture-of-Experts) 추론 커널인 TritonMoE가 공개되었습니다. 이 커널은 특정 벤더의 CUDA에 의존하지 않고 NVIDIA와 AMD GPU 모두에서 동작할 수 있는 높은 이식성을 제공합니다.

핵심 기술로는 Fused gate+up GEMM 방식이 도입되었습니다. 이는 SwiGLU 프로젝션을 공유 타일 로드에서 함께 계산하여 전역 메모리 트래픽을 35% 절감합니다.

성능 측면에서는 A100에서 Megablocks 대비 89~131%의 처리량을 보여주었으며, 동일한 커널을 수정 없이 AMD MI300X에서도 실행할 수 있습니다. 다만, 토큰 수가 2048개를 초과하거나 64개 이상의 전문가가 극심한 라우팅 불균형을 보일 경우 성능이 저하되는 특성이 있습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.