LG AI Research: EXAONE 멀티모달 모델의 기술적 원리
·2026.07.16 09:00
LG AI Research가 텍스트와 이미지를 양방향으로 이해하는 EXAONE 멀티모달 모델의 구조를 공개했다.
기존 Vision AI가 이미지 인식에 집중했다면, 최근의 흐름은 텍스트를 이미지로 생성하는 Text-to-Image와 같은 생성형 모델로 진화하고 있다. OpenAI의 DALL-E가 대표적이지만, LG AI Research의 EXAONE은 한 단계 더 나아간 기술을 선보인다.
EXAONE 멀티모달 모델은 단방향 학습을 넘어, 이미지를 보고 텍스트를 생성하거나 텍스트를 통해 이미지를 생성할 수 있는 양방향(Bi-directional) 학습 모델이다. 이를 통해 단순한 사물 묘사를 넘어 '봄의 에너지'와 같은 추상적인 개념까지 시각화할 수 있다.
모델의 핵심 기술 중 하나는 **AugVAE(Feature-Augmented Variational AutoEncoder)**이다. 이는 기존의 VQ-VAE를 개선한 모델로, 다음과 같은 특징을 가진다.
- Autoencoder: 데이터를 압축하는 Encoder와 복원하는 Decoder로 구성되어 잠재 공간(Latent Space)에 데이터를 표현한다.
- VAE (Variational Autoencoder): 일반적인 Autoencoder와 달리 잠재 공간을 체계적으로 조직화하여, 데이터의 특징을 더 잘 학습하고 생성 성능을 높인다.
LG AI Research는 총 2억 5천만 개의 이미지-텍스트 쌍 데이터를 확보하여 모델의 학습에 활용했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.