AI Briefing

Transformer 최적화용 CODA 커널 공개

CODA: Rewriting Transformer Blocks as GEMM-Epilogue Programs

·2026.05.23 04:25

Transformer 학습의 메모리 병목을 해결하기 위해 GEMM-Epilogue 방식을 사용하는 GPU 커널 추상화 CODA를 제안한다.

Transformer 학습 시스템은 밀집 선형 대수(dense linear algebra)를 중심으로 구축되지만, Normalization, Activation, Residual update와 같은 메모리 집약적(memory-bound) 연산이 전체 성능의 병목이 되고 있다. 이러한 연산들은 산술 연산량에 비해 대규모 중간 텐서를 글로벌 메모리로 반복적으로 이동시키기 때문이다.

CODA는 이러한 연산들을 GEMM-plus-epilogue 프로그램으로 표현하는 새로운 GPU 커널 추상화 기술이다. 이 방식은 GEMM 출력 타일이 메모리에 기록되기 전, 칩 위에 머물러 있는 상태에서 관련 연산을 수행하도록 설계되었다.

CODA의 주요 특징은 다음과 같다:

  • 효율적인 데이터 재사용: GEMM 메인루프를 고정하고 스케일링, 리덕션, 쌍별 변환(pairwise transformations) 등을 위한 컴포저블 에필로그 프리미티브를 제공한다.
  • 높은 성능: 전문가가 작성한 커널뿐만 아니라 LLM이 작성한 커널로도 높은 성능을 달성하여, 프레임워크 수준의 생산성과 하드웨어 수준의 효율성을 동시에 확보할 수 있음을 보여준다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.