AI Briefing

멀티모달 사전학습의 물리학을 향해: 지식 흐름, 모달리티 시너지, 조기 통합과 학습 레시피

·2026.08.07 09:00

핵심 내용

멀티모달 모델은 모달리티를 초기부터 함께 학습할 때 더 효과적으로 발전했다.

자세히 보기

멀티모달 사전학습에서 언어와 시각 정보가 어떻게 상호작용하는지 체계적으로 분석한 연구가 나왔다. 연구진은 합성 데이터와 대규모 실제 데이터에 대한 통제 실험을 통해 지식 전달, 모달리티 간 시너지와 경쟁, 학습 시점의 영향을 조사했다.

실험 결과 언어 이해, 시각 이해, 시각 생성 사이의 지식 흐름에는 서로 다른 영향력과 비대칭성이 존재했다. 데이터의 복잡도는 모달리티가 서로 시너지를 내는지 경쟁하는지를 좌우하는 주요 요인으로 나타났다.

아키텍처 측면에서는 다음과 같은 구성이 모달리티 간 협력을 촉진했다.

  • Attention과 정규화 계층은 공유
  • Feed-forward 계층은 모달리티별로 분리
  • 시각 토크나이저 설계가 달라져도 관찰된 경향은 유지

모달리티를 학습 후반에 연결하거나 순차적으로 훈련하는 것보다 초기 단계부터 통합해 공동 학습하는 방식이 더 효과적이었다. 통합이 늦어지면 모델이 언어적 사전지식에 의존해 시각 정보를 충분히 학습하지 않는 비전 게으름(vision laziness) 현상도 나타났다.

연구진은 계산 예산의 **5%**만 사용해도 강력한 생성 성능을 확보할 수 있는 사전학습 레시피를 제시했다. 또한 13.5B MoE 모델 여러 개를 2T 토큰으로 학습해 핵심 결과를 대규모 환경에서 검증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.