AI Briefing

LG AI Research 183

·2026.07.16 09:00

핵심 내용

LG AI연구원이 텍스트와 이미지를 양방향으로 이해하는 멀티모달 모델 EXAONE의 기술적 원리를 공개했다.

1 / 2

자세히 보기

기존 비전 AI가 이미지 인식에 집중하거나, OpenAI의 DALL-E가 텍스트를 이미지로 변환하는 한 방향 학습에 머물렀다면, EXAONE은 이미지로부터 텍스트를 생성하는 능력까지 갖춘 양방향 멀티모달 모델이다.

이 모델의 핵심은 AugVAE(feature-Augmented Variational AutoEncoder) 기술에 있다. 이는 기존 VQ-VAE의 구조를 개선하여, 이미지를 압축하는 중간 단계마다 비주얼 코드북(Visual Codebook) 컴포넌트를 여러 차례 배치한 것이 특징이다.

이러한 구조적 차별화를 통해 다음과 같은 성능 향상을 이뤄냈다:

  • 이미지의 패턴을 크기에 상관없이 정교하게 구분하고 기억함
  • 잠재 공간(Latent Space) 내에 데이터 특징을 더욱 잘 정돈하여 배치
  • 텍스트와 이미지 간의 고도화된 상호 이해 가능

LG AI연구원은 총 2억 5천만 쌍의 이미지-텍스트 쌍 데이터를 활용하여 모델을 학습시켰으며, 이를 통해 단순한 객체 인식을 넘어 '봄의 기운'과 같은 추상적인 개념까지 이미지로 구현할 수 있는 능력을 확보했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.