AI Briefing

Hugging Face, Ulysses SP 지원

Ulysses Sequence Parallelism: Training with Million-Token Contexts

·2026.03.09 09:00

Hugging Face가 백만 토큰 이상의 긴 컨텍스트 학습을 지원하는 Ulysses Sequence Parallelism을 주요 라이브러리에 통합했다.

문서 분석, 코드 이해, RAG 등 긴 컨텍스트 처리가 중요해짐에 따라 수십만에서 수백만 토큰에 이르는 시퀀스 학습 기술이 필수적이다. 그러나 기존 어텐션 메커니즘은 시퀀스 길이에 따라 메모리 사용량이 제곱으로 증가하는 한계가 있다.

**Ulysses Sequence Parallelism (SP)**는 어텐션 헤드 병렬화를 통해 어텐션 연산을 여러 GPU에 분산하여 이 문제를 해결한다. 주요 작동 방식은 다음과 같다:

  • 시퀀스 샤딩(Sequence Sharding): 입력 시퀀스를 여러 GPU에 나누어 할당한다.
  • All-to-All 통신: QKV 프로젝션 후 데이터를 재분배하여, 각 GPU가 전체 시퀀스 위치에 대한 특정 어텐션 헤드 부분집합을 처리하도록 한다.
  • 로컬 어텐션: 각 GPU는 할당된 헤드에 대해 FlashAttention 등을 사용하여 어텐션을 계산한다.
  • 데이터 복구: 다시 All-to-All 통신을 통해 원래의 시퀀스 샤딩 형식으로 되돌린다.

Hugging Face는 이 기술을 Accelerate, Transformers Trainer, 그리고 TRL의 SFTTrainer에 통합하여 개발자들이 긴 컨텍스트 모델을 더 쉽게 학습할 수 있도록 지원한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.