AI Briefing

MLSys를 위한 현대적 GPU 프로그래밍

·2026.06.23 20:38

핵심 내용

카네기 멜론 대학교의 강의를 기반으로 Blackwell 아키텍처 최적화 기법을 다루는 GPU 프로그래밍 가이드가 공개되었습니다.

자세히 보기

현대 AI 워크로드의 성능은 Attention kernel, LLM prefill/decode, MoE layers와 같은 핵심 GPU 커널의 품질에 의해 결정됩니다. 본 가이드는 단순한 최적화 기법을 넘어, 최신 GPU 아키텍처의 복잡한 메모리 구조와 실행 유닛을 이해하고 활용하는 법을 다룹니다.

주요 학습 내용은 다음과 같습니다:

  • GPU 하드웨어 이해: 데이터 레이아웃, 비동기 데이터 이동(TMA), 비동기 조정(mbarriers) 등 하드웨어 직결 개념
  • TIRx 활용: 하드웨어 제어력을 유지하면서 실행 가능한 코드를 작성할 수 있는 Python DSL 사용
  • 핵심 커널 구현:
    • GEMM: TMA 파이프라이닝, 지속적 스케줄링(Persistent scheduling), Warp specialization 등을 적용한 최적화
    • Flash Attention 4: 온라인 소프트맥스 재스케일링, GQA(Grouped Query Attention) 등을 포함한 최첨단 어텐션 커널 구현

이 자료는 Blackwell 세대 GPU를 주요 타겟으로 하며, 고성능 커널 구축을 위한 체계적인 단계별 학습 과정을 제공합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.