AI Briefing

[CVPR 2022] 거대 시각-언어 모델(Large Vision-Language Model): 다음 단계는 무엇인가?

·2026.07.16 09:00

NLP의 성공을 따라 시각-언어 분야에서도 대규모 데이터와 인프라를 활용한 거대 모델 학습이 가속화되고 있다.

NLP 분야에서 GPT-3가 불러온 대규모 모델 학습의 열풍은 이제 시각-언어(Vision-Language) 분야로 확장되고 있다. 모델의 파라미터 수는 정보의 다양성을 결정하지만, 규모가 커질수록 막대한 데이터와 GPU 자원이 요구된다.

Phase 1에서는 OpenAI의 DALL-E가 등장하며 zero-shot text-to-image generation 시대를 열었다. DALL-E는 1,200억 개의 파라미터를 가진 Transformer 모델로, 2억 5천만 개의 이미지-텍스트 쌍을 학습하여 학습 데이터에 없던 개념도 생성할 수 있다. 이때 이미지와 텍스트 간의 유사도 분석을 위해 CLIP 모델이 활용된다.

Phase 2VQ-VAE(Vector Quantized-Variational AutoEncoder)와 Transformer의 결합을 다룬다. DALL-E는 텍스트 전용이었던 Transformer를 이미지에도 적용하기 위해 VQ-VAE를 사용한다.

VQ-VAE는 이미지를 압축하는 인코더와 복원하는 디코더로 구성된다. 특히 Vector Quantization(VQ) 과정을 통해 압축된 정보를 특정 크기의 토큰으로 분리하고, 이를 코드북(Codebook) 내의 가장 유사한 토큰으로 대체함으로써 이미지를 텍스트와 유사한 포맷으로 변환하여 학습 효율을 높인다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.