AI Briefing

LG의 첫 공개 Vision Language Model, EXAONE 4.5 - LG AI Research BLOG

·2026.07.16 09:00

LG AI연구원이 시각 정보와 언어를 동시에 처리하는 오픈 웨이트 VLM인 EXAONE 4.5를 공개했다.

LG AI연구원이 최초의 오픈 웨이트 방식 **Vision Language Model(VLM)**인 EXAONE 4.5를 선보였다. 기존 언어 중심 구조에서 벗어나 자체 개발한 Visual Encoder를 통합함으로써, 텍스트와 이미지를 동시에 이해하는 진정한 멀티모달(Multimodal) 모델로 진화했다.

모델의 핵심은 네이티브 멀티모달 사전학습(Native Multimodal Pretraining) 방식이다. 시각과 언어 모듈을 단순히 결합하는 대신, 처음부터 두 정보를 함께 학습하여 멀티모달 이해 능력을 극대화했다. 또한 STEM문서 이해(Document Understanding) 영역에 특화된 데이터를 구축하여 산업 현장에서의 실용성을 높였다.

기술적 최적화와 추론 속도 개선을 위해 다음과 같은 설계를 적용했다.

  • GQA(Grouped Query Attention): Visual Encoder 내 어텐션 메커니즘에 적용하여 연산량과 메모리 사용량을 줄이고 추론 속도를 확보했다.
  • MTP(Multi-Token Prediction): 단일 토큰 예측을 넘어 다음 토큰들을 동시에 예측함으로써, 기존 대비 추론 속도를 약 1.5배 이상 향상시켰다.

학습 단계에서는 사고 궤적(Thinking Trajectory)을 포함한 고품질 데이터를 활용해 논리적 추론 능력을 강화했다. 사후학습 단계에서는 자체 개발한 AGAPO 알고리즘을 도입했다. 이 알고리즘은 오답 속에서도 학습 신호를 찾아내는 비대칭 샘플링과 안정적인 이점 계산을 통해 모델의 논리적 오류를 스스로 피하도록 유도하며 학습 효율을 높였다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.