AI Briefing

Hugging Face, TensorFlow 모델 성능 개선

Faster TensorFlow models in Hugging Face Transformers

·2021.01.26 09:00

Hugging Face Transformers의 TensorFlow 모델 성능이 개선되어 Google 구현체 대비 최대 10% 빨라졌다.

Hugging Face 팀은 Transformers 라이브러리의 TensorFlow 모델을 더욱 견고하고 빠르게 만들기 위한 업데이트를 진행했다. 이번 개선은 BERT, RoBERTa, ELECTRA, MPNet 모델의 연산 성능 향상과 TensorFlow Serving을 통한 효율적인 배포에 초점을 맞추고 있다.

주요 성능 개선 사항

  • 연산 성능 향상: BERT 모델 기준, Google의 공식 구현체보다 최대 약 10% 더 빠른 성능을 기록했다. 이는 이전 버전(v4.1.1) 대비 약 2배 빠른 속도다.
  • 범용적 이점: Graph/Eager 모드, TF Serving, 그리고 CPU/GPU/TPU 모든 장치 환경에서 성능 향상이 나타난다.

TensorFlow Serving 배포 지원 생산 환경에서 모델을 효율적으로 배포할 수 있도록 SavedModel 형식을 지원한다. Transformers v4.2.0부터는 SavedModel 생성 시 다음과 같은 기능이 추가되었다:

  • 실행 간 시퀀스 길이(sequence length) 자유 변경 가능
  • 추론 시 모든 모델 입력값 사용 가능
  • hidden statesattention 출력을 단일 그룹으로 통합 제공

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.