AI Briefing

Unsloth와 NVIDIA로 LLM 학습을 더 빠르게 만들기

·2026.05.07 16:15

Unsloth가 NVIDIA와 협업해 LLM 학습 속도를 약 25% 높였다.

Unsloth가 NVIDIA와 함께 LLM 학습 경로를 최적화해 전체 속도를 약 25% 더 끌어올렸다고 밝혔다. 이번 개선은 정확도 손실 없이 적용되며, 기존의 2~5배 빠른 Unsloth 속도 향상 위에 더해진다. 최신 버전으로 업데이트하면 RTX 노트북, 데이터센터 GPU, DGX Spark에서 자동 활성화된다.

핵심 개선은 세 가지다.

  • packed sequence 메타데이터를 레이어마다 다시 만들지 않고 캐싱해 14.3% 빨라졌다.
  • double-buffered async gradient checkpointing으로 8% 성능이 개선됐다.
  • gpt-oss의 MoE 라우팅에서 argsortbincount를 써 15% 학습 속도를 높였다.

packed batch에서는 길이, cu_seqlens, 최대 시퀀스 길이, attention 구조가 여러 레이어에서 동일하다. 이 정보를 한 번만 만들고 재사용하면 반복적인 CPU-GPU 동기화와 준비 비용을 줄일 수 있고, 그 결과 forward 경로의 병목이 낮아진다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.