AI Briefing

LG AI Research 407

·2026.07.16 09:00

LLM을 활용해 텍스트 기반 이상치(Outlier)를 생성함으로써 시각적 OOD 탐지 성능을 높이는 연구를 소개한다.

LG AI Research의 DI(Data Intelligence) Lab은 OOD(Out-of-Distribution) 탐지 성능을 향상시키기 위해 합성 이상치(Synthetic Outlier)를 생성하는 연구를 진행하고 있다. 특히 이번 연구는 기존의 시각적 이상치 노출 방식에서 벗어나, **LLM(Large Language Model)**을 활용한 **텍스트 기반 이상치 노출(Textual Outlier Exposure)**을 제안한다.

기존 방식은 이미지 도메인의 시각적 이상치에 의존했으나, 이는 OOD에 대한 명시적 지식 없이 보조 데이터셋을 사용할 경우 성능 편차가 크고 시간이 많이 소요되는 단점이 있었다. 이를 해결하기 위해 연구진은 CLIP과 같은 멀티모달 네트워크를 기반으로, 텍스트를 통해 이미지 도메인의 탐지기를 정규화하는 프레임워크를 구축했다.

텍스트 이상치는 세 가지 수준으로 생성된다:

  • Word-level: 'a photo of {word}' 형태의 직관적인 단어 기반 생성
  • Description-level: GPT-3를 활용하여 클래스 이름을 제외한 상세 설명을 생성
  • Caption-level: BLIP-2를 통해 이미지의 시각적 단서로부터 풍부한 시각적 의미를 담은 캡션을 추출

실험 결과, Caption-level 텍스트 이상치가 가장 우수한 성능을 보였으며, 이는 단순 텍스트 설명을 넘어 시각적 요소를 포함한 풍부한 언어적 의미를 반영했기 때문이다. 해당 방법론은 ImageNet-1K 벤치마크에서 기존의 최첨단 시각적 이상치 노출 방식보다 뛰어난 성능을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.