AI Briefing

새로운 화담숲: LMM을 통한 이미지 이해 및 생성

·2026.07.16 09:00

LG AI Research가 기존 LMM의 데이터 라이선스 문제를 해결하고 효율성을 높인 EXAONE LMM 구조를 제안했다.

최근 AI 기술은 예술적 창의 과정을 돕는 파트너로 진화하고 있으며, The New Hwadamsup Project는 인간과 AI의 협업을 통해 미디어 아트를 구현한 대표적 사례다. 이 프로젝트에는 LG AI Research의 EXAONE 이미지 이해 및 생성 기술이 활용되었다.

이미지 이해(Image Understanding)는 **VLM(Vision-Language Model)**이나 **LMM(Large Multimodal Model)**을 통해 이미지에 대한 질문에 답하는 작업이다. 대표적인 모델인 LLaVA는 비전 인코더와 프로젝션 레이어를 통해 이미지를 LLM이 이해할 수 있는 형태로 변환하는 구조를 가진다.

하지만 기존 LMM은 성능 향상을 위해 GPT로 생성한 방대한 양의 Instruction Tuning 데이터에 의존하며, 이는 라이선스 이슈와 높은 비용 문제를 안고 있다. 이를 해결하기 위해 제안된 것이 EXAONE LMM이다.

EXAONE LMM의 핵심 특징은 다음과 같다:

  • 구조적 차별화: 캡셔닝(Captioning)과 디텍션(Detection) 모듈을 통해 이미지 정보를 추출한 뒤, **SLM(Small Language Model)**이 이를 하나의 문장으로 정리하여 LLM에 전달한다.
  • 효율적 학습: LLM을 직접 훈련시키는 대신, 정보를 정리하는 역할의 SLM만 학습시키므로 훨씬 적은 데이터와 빠른 속도로 학습이 가능하다.
  • 정밀도 향상: 고수준의 비전 특징을 활용함으로써 기존 모델이 취약했던 객체 수 세기(Counting) 등의 작업에서 더 뛰어난 성능을 보인다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.