Flash Attention 2 패킹 기능 지원
Improving Hugging Face Training Efficiency Through Packing with Flash Attention 2
·2024.08.21 09:00
핵심 내용
Hugging Face가 Flash Attention 2와 호환되는 패킹 기능을 도입하여 LLM 학습 효율을 최대 2배 높였다.
1 / 2
자세히 보기
Hugging Face Transformers와 TRL 라이브러리에 패킹(Packing) 기술을 활용한 새로운 데이터 콜레이터가 도입되었다.
기존 패킹 방식은 Flash Attention 2 사용 시 예제 간 경계(boundary)를 구분하지 못해 학습 품질이 저하되는 문제가 있었으나, 이번 업데이트를 통해 경계 인지(boundary awareness)가 가능해졌다.
주요 성과:
- 학습 처리량(Throughput): FLAN 데이터셋 기준, Llama 2-7B 및 Mistral-7B 모델에서 최대 2배의 처리량 향상을 보였다.
- 메모리 사용량: FLAN 데이터셋에서 피크 메모리 사용량을 약 20% 절감했다.
- 학습 품질: 패딩(Padding)을 사용하는 기존 방식과 비교했을 때 검증 손실(Validation Loss) 측면에서 차이가 없어, 수렴 품질을 그대로 유지한다.
사용 방법:
transformers라이브러리:DataCollatorWithFlattening사용.trl라이브러리:DataCollatorForCompletionOnlyLM호출 시padding_free=True플래그 설정.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.