Cursor, NVL72용 MoE 커널 공개
Mixture-of-Kittens: Cursor가 새로 공개한 NVL72용 MoE 학습 메가커널
·2026.08.07 12:30
핵심 내용
Cursor가 NVL72용 MoE 통신·연산 융합 커널을 공개하고 처리량 1.41배 향상을 보고했다.
자세히 보기
Cursor가 GB300 NVL72 랙을 겨냥한 오픈소스 MoE 학습 메가커널 Mixture-of-Kittens(MoK) 를 공개했다.
MoK는 전문가 병렬화에서 발생하는 디스패치·결합 all-to-all 통신과 전문가 FFN 연산을 하나의 CUDA 커널로 융합해, 통신을 연산과 겹쳐 숨기는 방식으로 설계됐다. 같은 입력에 대해 비트 단위로 동일한 출력을 내는 결정론적 실행도 지원한다.
주요 설계 방향은 다음과 같다.
- NVL72의 단일 NVLink 도메인 특성을 활용한 세밀한 통신·연산 파이프라이닝
- CPU 개입과 CPU-GPU 동기화를 줄이는 링 버퍼 기반 실행 구조
- DSV3 스타일의 공유 전문가와 수백 개 라우팅 전문가를 사용하는 MoE 계층 최적화
- 푸시·풀 통신 방식과 통신·연산 청크 크기를 워크로드에 맞춰 조정
Cursor는 Composer 학습에 MoK를 적용한 결과 자사 프로덕션 스택의 종단간 초당 토큰 처리량이 1.41배 향상됐으며, 수만 장 규모의 GPU 학습에 사용 중이라고 밝혔다. 구현은 Apache 2.0 라이선스로 공개됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.