AI Briefing

Flash Attention 2 패킹 기능 지원

Improving Hugging Face Training Efficiency Through Packing with Flash Attention 2

·2024.08.21 09:00

핵심 내용

Hugging Face가 Flash Attention 2와 호환되는 패킹 기능을 도입하여 LLM 학습 효율을 최대 2배 높였다.

1 / 2

자세히 보기

Hugging Face Transformers와 TRL 라이브러리에 패킹(Packing) 기술을 활용한 새로운 데이터 콜레이터가 도입되었다.

기존 패킹 방식은 Flash Attention 2 사용 시 예제 간 경계(boundary)를 구분하지 못해 학습 품질이 저하되는 문제가 있었으나, 이번 업데이트를 통해 경계 인지(boundary awareness)가 가능해졌다.

주요 성과:

  • 학습 처리량(Throughput): FLAN 데이터셋 기준, Llama 2-7B 및 Mistral-7B 모델에서 최대 2배의 처리량 향상을 보였다.
  • 메모리 사용량: FLAN 데이터셋에서 피크 메모리 사용량을 약 20% 절감했다.
  • 학습 품질: 패딩(Padding)을 사용하는 기존 방식과 비교했을 때 검증 손실(Validation Loss) 측면에서 차이가 없어, 수렴 품질을 그대로 유지한다.

사용 방법:

  • transformers 라이브러리: DataCollatorWithFlattening 사용.
  • trl 라이브러리: DataCollatorForCompletionOnlyLM 호출 시 padding_free=True 플래그 설정.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.