AI Briefing

LG AI Research 183

·2026.07.16 09:00

LG AI연구원이 텍스트와 이미지를 양방향으로 이해하는 멀티모달 모델 EXAONE의 기술적 원리를 공개했다.

기존 비전 AI가 이미지 인식에 집중하거나, OpenAI의 DALL-E가 텍스트를 이미지로 변환하는 한 방향 학습에 머물렀다면, EXAONE은 이미지로부터 텍스트를 생성하는 능력까지 갖춘 양방향 멀티모달 모델이다.

이 모델의 핵심은 AugVAE(feature-Augmented Variational AutoEncoder) 기술에 있다. 이는 기존 VQ-VAE의 구조를 개선하여, 이미지를 압축하는 중간 단계마다 비주얼 코드북(Visual Codebook) 컴포넌트를 여러 차례 배치한 것이 특징이다.

이러한 구조적 차별화를 통해 다음과 같은 성능 향상을 이뤄냈다:

  • 이미지의 패턴을 크기에 상관없이 정교하게 구분하고 기억함
  • 잠재 공간(Latent Space) 내에 데이터 특징을 더욱 잘 정돈하여 배치
  • 텍스트와 이미지 간의 고도화된 상호 이해 가능

LG AI연구원은 총 2억 5천만 쌍의 이미지-텍스트 쌍 데이터를 활용하여 모델을 학습시켰으며, 이를 통해 단순한 객체 인식을 넘어 '봄의 기운'과 같은 추상적인 개념까지 이미지로 구현할 수 있는 능력을 확보했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.