AI Briefing

MLSys를 위한 현대적 GPU 프로그래밍

·2026.06.23 20:38

카네기 멜론 대학교의 강의를 기반으로 Blackwell 아키텍처 최적화 기법을 다루는 GPU 프로그래밍 가이드가 공개되었습니다.

현대 AI 워크로드의 성능은 Attention kernel, LLM prefill/decode, MoE layers와 같은 핵심 GPU 커널의 품질에 의해 결정됩니다. 본 가이드는 단순한 최적화 기법을 넘어, 최신 GPU 아키텍처의 복잡한 메모리 구조와 실행 유닛을 이해하고 활용하는 법을 다룹니다.

주요 학습 내용은 다음과 같습니다:

  • GPU 하드웨어 이해: 데이터 레이아웃, 비동기 데이터 이동(TMA), 비동기 조정(mbarriers) 등 하드웨어 직결 개념
  • TIRx 활용: 하드웨어 제어력을 유지하면서 실행 가능한 코드를 작성할 수 있는 Python DSL 사용
  • 핵심 커널 구현:
    • GEMM: TMA 파이프라이닝, 지속적 스케줄링(Persistent scheduling), Warp specialization 등을 적용한 최적화
    • Flash Attention 4: 온라인 소프트맥스 재스케일링, GQA(Grouped Query Attention) 등을 포함한 최첨단 어텐션 커널 구현

이 자료는 Blackwell 세대 GPU를 주요 타겟으로 하며, 고성능 커널 구축을 위한 체계적인 단계별 학습 과정을 제공합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.