AI Briefing

LG AI Research의 첫 공개 Vision Language Model, EXAONE 4.5

·2026.07.16 09:00

LG AI Research가 텍스트와 이미지를 동시에 이해하는 멀티모달 모델 EXAONE 4.5를 오픈 웨이트 방식으로 공개했다.

LG AI Research가 기존 EXAONE 4.0의 언어 처리 능력을 시각 영역까지 확장한 EXAONE 4.5를 선보였다. 이번 모델은 텍 же스트와 시각 정보를 초기 단계부터 함께 학습하는 Native Multimodal Pretraining 방식을 채택하여 멀티모달 이해력을 극대화했다.

주요 기술적 특징은 다음과 같다:

  • 통합 Visual Encoder: 독자적인 비주얼 인코더를 통합하였으며, GQA(Grouped Query Attention) 방식을 적용해 연산 부하를 줄이고 추론 속도를 최적화했다.
  • Multi-Token Prediction (MTP): 기존의 순차적 토큰 생성 방식에서 벗어나 다음 토큰을 동시에 예측함으로써, 기존 대비 추론 속도를 1.5배 이상 향상시켰다.
  • 산업 특화 성능: STEM(과학, 기술, 공학, 수학) 분야와 문서 이해(Document Understanding)에 최적화되어 있으며, 한국어 및 시각적 맥락 이해에서도 뛰어난 성능을 보인다.

EXAONE 4.5는 대규모 데이터셋을 바탕으로 언어와 비전 분야 모두에서 균형 잡힌 성능을 구현하며, 실제 산업 현장에서 요구되는 복잡한 문서 기반 작업에 강점을 가진다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.