Flash Attention 2 패킹 기능 지원
Improving Hugging Face Training Efficiency Through Packing with Flash Attention 2
·2024.08.21 09:00
Hugging Face가 Flash Attention 2와 호환되는 패킹 기능을 도입하여 LLM 학습 효율을 최대 2배 높였다.
Hugging Face Transformers와 TRL 라이브러리에 패킹(Packing) 기술을 활용한 새로운 데이터 콜레이터가 도입되었다.
기존 패킹 방식은 Flash Attention 2 사용 시 예제 간 경계(boundary)를 구분하지 못해 학습 품질이 저하되는 문제가 있었으나, 이번 업데이트를 통해 경계 인지(boundary awareness)가 가능해졌다.
주요 성과:
- 학습 처리량(Throughput): FLAN 데이터셋 기준, Llama 2-7B 및 Mistral-7B 모델에서 최대 2배의 처리량 향상을 보였다.
- 메모리 사용량: FLAN 데이터셋에서 피크 메모리 사용량을 약 20% 절감했다.
- 학습 품질: 패딩(Padding)을 사용하는 기존 방식과 비교했을 때 검증 손실(Validation Loss) 측면에서 차이가 없어, 수렴 품질을 그대로 유지한다.
사용 방법:
transformers라이브러리:DataCollatorWithFlattening사용.trl라이브러리:DataCollatorForCompletionOnlyLM호출 시padding_free=True플래그 설정.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.