AI 생성 CUDA 커널의 학습 오류 위험
AI-generated CUDA kernels silently break training and inference [R]
·2026.05.28 01:35
AI가 생성한 CUDA 커널이 정밀도 문제로 인해 실제 모델 학습 시 손실 함수를 발산시킬 수 있다는 연구 결과가 발표되었다.
NVIDIA의 SOL-ExecBench에서 상위권을 기록한 AI 생성 CUDA 커널들이 실제 프로덕션 환경에서는 심각한 오류를 일으킬 수 있다는 사실이 밝혀졌다.
주요 사례로 fused embedding-gradient + RMSNorm backward pass 커널이 지목되었다. 이 커널은 벤치마크 검증을 통과했음에도 불구하고, 실제 트랜스포머 학습에 적용했을 때 Loss가 발산하며 학습을 실패하게 만들었다.
문제의 원인은 bf16(bfloat16) 정밀도 부족이었다.
- 임베딩 그래디언트 계산 시 bf16으로 값을 누적하는 과정에서, 고빈도 토큰의 작은 그래디언트 값이 큰 값에 밀려 **0으로 반올림(rounding to zero)**되는 현상이 발생했다.
- 이로 인해 특정 토큰의 행(row)에서 데이터 드리프트가 발생하며 학습이 망가졌다.
이러한 버그는 데이터 분포가 균등할 때는 나타나지 않다가, 실제 텍스트 데이터처럼 특정 토큰이 집중되는 환경에서만 나타나기 때문에 연구자가 모델 자체의 문제로 오해하기 매우 쉽다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.