AI Briefing

Hugging Face, Ulysses SP 지원

Ulysses Sequence Parallelism: Training with Million-Token Contexts

·2026.03.09 09:00

핵심 내용

Hugging Face가 백만 토큰 이상의 긴 컨텍스트 학습을 지원하는 Ulysses Sequence Parallelism을 주요 라이브러리에 통합했다.

자세히 보기

문서 분석, 코드 이해, RAG 등 긴 컨텍스트 처리가 중요해짐에 따라 수십만에서 수백만 토큰에 이르는 시퀀스 학습 기술이 필수적이다. 그러나 기존 어텐션 메커니즘은 시퀀스 길이에 따라 메모리 사용량이 제곱으로 증가하는 한계가 있다.

**Ulysses Sequence Parallelism (SP)**는 어텐션 헤드 병렬화를 통해 어텐션 연산을 여러 GPU에 분산하여 이 문제를 해결한다. 주요 작동 방식은 다음과 같다:

  • 시퀀스 샤딩(Sequence Sharding): 입력 시퀀스를 여러 GPU에 나누어 할당한다.
  • All-to-All 통신: QKV 프로젝션 후 데이터를 재분배하여, 각 GPU가 전체 시퀀스 위치에 대한 특정 어텐션 헤드 부분집합을 처리하도록 한다.
  • 로컬 어텐션: 각 GPU는 할당된 헤드에 대해 FlashAttention 등을 사용하여 어텐션을 계산한다.
  • 데이터 복구: 다시 All-to-All 통신을 통해 원래의 시퀀스 샤딩 형식으로 되돌린다.

Hugging Face는 이 기술을 Accelerate, Transformers Trainer, 그리고 TRL의 SFTTrainer에 통합하여 개발자들이 긴 컨텍스트 모델을 더 쉽게 학습할 수 있도록 지원한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.