AI Briefing

transformers, gpt-oss 최적화 업데이트

Tricks from OpenAI gpt-oss YOU 🫵 can use with transformers

·2025.09.11 09:00

Hugging Face transformers 라이브러리가 OpenAI gpt-oss 모델 지원을 위한 대규모 업데이트를 발표했다.

Hugging Face는 OpenAI의 gpt-oss 모델 시리즈를 효율적으로 로드, 실행 및 미세 조정할 수 있도록 transformers 라이브러리를 대폭 업데이트했습니다. 이번 업데이트는 gpt-oss뿐만 아니라 향후 출시될 다른 모델들도 혜택을 볼 수 있는 범용적인 기술들을 포함합니다.

주요 업데이트 내용은 다음과 같습니다:

  • Zero-build Kernels: 커스텀 커널을 별도의 빌드 과정 없이 허브에서 직접 다운로드하여 사용할 수 있어, 의존성 문제를 해결하고 설치 편의성을 높였습니다.
  • MXFP4 양자화: 새로운 MXFP4 양자화 기술을 지원합니다.
  • 병렬 처리 최적화: Tensor ParallelismExpert Parallelism을 지원하여 대규모 모델 처리를 가속화합니다.
  • 추론 효율성 향상: Dynamic Sliding Window Layer & Cache, Continuous Batching, Paged Attention 등을 통해 추론 성능을 극대화했습니다.
  • 모델 로딩 속도 개선: 대규모 모델을 더욱 빠르게 로드할 수 있는 기능을 추가했습니다.

이러한 최적화 기술들은 transformers 생태계 내의 다양한 모델에 적용될 수 있도록 설계되었습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.