속도와 비용의 열쇠: 멀티모달 AI 학습을 갉아먹는 ‘이미지 토큰 불균형’
핵심 내용
팀네이버가 이미지 토큰 불균형을 해결해 멀티모달 모델 학습 처리량을 13.3% 높였다.
자세히 보기
소버린 AI 개발에서 GPU 인프라를 효율적으로 활용하는 일은 막대한 비용 절감과 직결된다. Meta의 자료를 기준으로 Llama 4 사전학습에는 H100 GPU 누적 738만 시간이 투입됐으며, 학습 속도 1% 향상도 수억 원 규모의 비용 절감으로 이어질 수 있다.
팀네이버는 자체 클러스터에서 멀티모달 모델을 확장하던 중, GPU 수가 늘어날수록 학습 속도가 기대만큼 높아지지 않는 GPU 간 연산 부하 불균형을 발견했다. 일부 GPU가 이미지가 많은 데이터를 맡아 늦어지면, 수천 대의 GPU가 동기화 지점인 All-reduce에서 대기하는 Straggler 문제가 발생한다.
VLM은 텍스트를 처리하는 LLM 백본과 이미지를 이미지 임베딩으로 변환하는 Vision Encoder로 구성된다. LLM의 연산량은 이미지 토큰과 텍스트 토큰의 총합에 좌우되지만, Vision Encoder의 연산량은 이미지 토큰 수에만 비례하기 때문에 GPU별 이미지 토큰 편차가 전체 처리 속도를 크게 흔든다.
대규모 학습에는 다음과 같은 방식이 함께 사용된다.
- Data Parallelism: 여러 GPU가 데이터를 나눠 처리한 뒤 Gradient를 All-reduce로 합산한다.
- Gradient Accumulation: 여러 Micro-batch의 Gradient를 모아 한 번에 가중치를 업데이트한다.
- Sequence Packing: 길이가 다른 샘플을 고정 길이 시퀀스에 빈틈없이 담아 패딩으로 인한 연산 낭비를 줄인다.
Gradient는 합산 순서를 바꿔도 결과가 같기 때문에, 한 번의 가중치 업데이트에 포함되는 Micro-batch의 배치를 재구성할 수 있다. 팀네이버는 이를 바탕으로 이미지 토큰을 효율적으로 패킹하고 GPU 간 부하를 재분배했으며, 30B MoE 멀티모달 모델의 전체 학습 처리량을 50.2%, 이미지 토큰 불균형을 해결한 패킹·재분배만으로 13.3% 향상했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.