AI Briefing

LG AI Research: CVPR 2022 현장 스케치

·2026.07.16 09:00

LG AI Research가 CVPR 2022에 참가하여 멀티모달 표현 학습과 L-Verse 연구를 선보였다.

지난 6월 뉴올리언스에서 개최된 CVPR 2022에서 LG AI Research는 비전 연구의 최전선을 경험하며 기업 부스를 운영했다. 이번 컨퍼런스에서는 시각 정보를 넘어 텍스트, 소리 등 다양한 데이터를 통합하는 **멀티모달 표현 학습(Multimodal Representation Learning)**이 주요 화두로 떠올랐다.

주요 연구 사례로 소개된 MERLOT Reserve는 비디오 내의 이미지, 텍스트 자막, 오디오 정보를 단일 Transformer 모델을 통해 동시에 학습하는 방식이다. 2,000만 개의 비디오 데이터를 활용해 학습된 이 모델은 기존의 이미지와 텍스트 중심 모델보다 비디오 질의응답(VQA) 및 상식(VCR) 관련 작업에서 탁월한 성능을 입증했다.

또한 LG AI Research는 이미지와 텍스트 간의 양방향 생성을 핵심으로 하는 L-Verse에 대한 구두 및 포스터 발표를 진행했다. 이는 대규모 시각-언어 모델(LVLM) 분야의 최신 발전 방향을 보여주는 연구로, 디지털 세계의 모든 데이터가 결국 0과 1로 구성된다는 관점에서 멀티모달 데이터를 어떻게 통합적으로 분석할 것인지에 대한 해답을 제시한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.