AI Briefing

멀티 에이전트 커널 최적화

·2026.04.15 09:00

핵심 내용

Cursor의 멀티 에이전트 시스템이 CUDA 커널 235개를 3주 만에 38% 빠르게 만들었다.

자세히 보기

Cursor는 NVIDIA와 함께 멀티 에이전트 하니스로 CUDA 커널 최적화를 수행했다. 3주 동안 235개 문제를 자율적으로 처리했고, Blackwell GPU 커널을 처음부터 어셈블리 수준까지 최적화해 38% geomean speedup을 달성했다.

문제 생성과 평가는 SOL-ExecBench로 진행됐다. 이 벤치마크는 124개 이상의 생산용 오픈소스 모델에서 나온 실제 추론·학습 워크로드를 바탕으로 문제를 만들고, 27대의 NVIDIA Blackwell 200 GPU에서 성능을 측정했다. 캐시 등으로 결과를 속여 하드웨어 한계를 넘는 경우는 검증 단계에서 무효 처리했다.

실험은 하나의 마크다운 파일에 정의된 조정 프로토콜로 운영됐다. 플래너 에이전트가 자율 워커들의 작업을 분배·재조정했고, 시스템은 실행 중에 직접 벤치마킹 파이프라인을 호출하며 테스트, 디버깅, 최적화를 반복했다. 솔루션은 두 가지 언어로 따로 작성됐다.

  • CUDA C with inline PTX: 레지스터와 ISA 수준까지 직접 다루며 하드웨어 저수준 추론 능력을 검증
  • CuTe DSL: 공개 학습 데이터에 적은 고수준 추상화를 문서만으로 익히는 능력을 검증

성과는 두 방식으로 제시됐다. 기준선은 싱글 에이전트로 최적화한 PyTorch 코드였고, 성능은 Geomean speedup과 이론적 한계 대비 성능을 나타내는 SOL score로 측정했다. 멀티 에이전트 시스템은 **235개 중 149개(63%)**에서 기준선을 이겼고, **45개(19%)**에서는 2배 이상 개선을 냈다.

대표 사례도 제시됐다.

  • BF16 Grouped Query Attention with Paged Prefill: SGLang의 Llama 3.1 8B용 프롬프트 단계 attention을 CUDA C++로 최적화해 SOL 0.9722, 기준선 대비 84% geomean speedup을 기록했고, SGLang에 교체 후 TTFT 3% 개선을 확인
  • NVFP4 MoE Linear with Gating: 양자화 병목을 찾아 scale 계산과 rounding을 융합하고, 16개 값만 존재하는 NVFP4의 특성을 이용해 threshold bucket으로 직접 매핑해 39% geomean speedup, 0.58 SOL 달성
  • BF16 Matrix Multiplication: Blackwell 전용 명령어와 메모리 접근을 학습해 맞춤 GEMM 커널을 생성했으며, NVIDIA cuBLAS 인간 베이스라인 대비 86% 수준까지 도달했고 작은 M 테스트에서는 최대 9% 더 빨랐음

Cursor는 아직 median SOL 0.56에 그쳐 개선 여지가 크다고 본다. 하지만 이 실험은 멀티 에이전트 구조가 긴 호흡의 개방형 소프트웨어 문제를 다루는 데 유효하며, 앞으로 Cursor의 핵심 제품에도 이런 기술이 반영될 것이라고 예고한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.