Encoder-Decoder MT 동적 배치
Dynamic batching for Encoder-Decoder MT training or generation when long sequence caps the batch size [P]
·2026.04.28 21:31
RTX 5090의 NLLB-200 600M 학습에서 동적 배치로 처리량을 3.3배 높였다.
RTX 5090에서 NLLB-200 600M을 미세조정할 때 고정 배치 크기 8이 OOM 한계였고, 긴 샘플 몇 개가 전체 배치를 묶어 GPU 활용률이 낮아졌다고 밝혔다.
dynabatch는 예제를 토큰 길이 기준으로 긴 것부터 정렬한 뒤, 가장 긴 배치를 기준점으로 삼아 더 짧은 배치에서는 후보 배치 크기를 키운다. 이후 XGB regressor로 메모리 압력을 예측해 안전 임계값을 넘지 않는 최대 배치를 고른다.
핵심 요지는 다음과 같다.
- encoder-decoder MT에서 소스 길이를 타깃 길이의 대리 지표로 활용
- 학습 벤치마크에서 고정 배치 대비 처리량 3.3배 향상
- Colab T4 생성 벤치마크에서는 1.06배~1.21배 수준의 개선
- 회귀기 오차와 OOM을 고려해 fallback 경로를 추가
decoder-only 모델에는 sequence packing이 더 적합하다고 봤고, 이 방법은 MT 중심의 니치한 배치 최적화 도구로 제시했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.