LG AI 연구원: 화담숲 프로젝트를 통한 Image Understanding 및 Generation 기술 적용
LG AI 연구원이 EXAONE의 Image Understanding과 Generation 기술을 결합해 화담숲 미디어아트를 구현한 사례를 소개한다.
AI 기술은 예술의 창작 과정을 혁신하며 예술가의 동반자 역할을 수행하고 있다. 화담숲 프로젝트는 AI가 주제 설정부터 시각적·청각적 효과 추천까지 수행하며 인간과 협력한 성공적인 미디어아트 사례다.
Image Understanding은 VLM, LMM 등 멀티모달 모델을 활용해 이미지 기반 문답을 수행하는 기술이다. 기존 LLaVA 구조는 Vision Encoder와 Projection Layer를 거쳐 LLM에 정보를 전달하지만, GPT 생성 데이터에 의존하여 라이선스 이슈가 발생할 수 있다는 단점이 있다.
이에 LG AI 연구원은 EXAONE LMM 구조를 제안했다. 이 모델은 다음과 같은 특징을 가진다.
Image Generation 기술 또한 핵심적인 역할을 한다. LG AI 연구원은 자체 이미지 생성 모델을 개발하여 EXAONE Atelier라는 이름으로 계열사의 디자인 프로세스에 활용하고 있다.
화담숲 프로젝트를 위해 특정 데이터를 학습하지 않은 기존 모델의 한계를 극복하고자, Customize Image Generation 모델을 개발했다. EXAONE Image Understanding 모델로 화담숲 영상에서 Image-Text Pair 데이터를 추출하고, LoRA 및 Dreambooth 등의 튜닝 기법을 적용하여 화담숲의 철학을 담은 맞춤형 모델을 완성했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.