AI Briefing

텍스트를 활용한 시각적 표현 정착을 통한 도메인 일반화 연구 - LG AI Research

·2026.07.16 09:00

핵심 내용

인간의 언어적 설명을 활용해 이미지 도메인이 바뀌어도 성능을 유지하는 도메인 일반화(DG) 기술을 제안했다.

1 / 2

자세히 보기

기존 기계학습 모델은 학습 데이터와 테스트 데이터의 분포가 다를 경우 성능이 급격히 하락하는 도메인 일반화(Domain Generalization, DG) 문제에 취약합니다. 이를 해결하기 위해 본 연구는 인간의 언어적 설명을 활용하는 Natural Language Supervision 방식을 제안합니다.

핵심은 모델이 이미지의 핵심 의미를 파악하도록 돕는 두 가지 모듈입니다.

  • Visual and Textual Joint Embedder: 이미지로부터 추출한 시각적 표현형을 문장의 의미와 정렬(Alignment)하여, 도메인 변화에 무관한 핵심 특징을 학습합니다.
  • Textual Explanation Generator: 모델의 결정 근거를 시각적 단서에 기반한 문장으로 생성하여 학습을 정착시킵니다.

이 방법론은 학습 단계에서 모델을 정착시키는 데 사용되며, 테스트 단계에서는 불필요하지만 원할 경우 결정 근거를 설명하는 용도로 활용할 수 있습니다. 연구 결과, 자체 구축한 CUB-DG 데이터셋과 DomainBed 벤치마크 모두에서 SOTA(State-of-the-art) 성능을 달성하며 뛰어난 일반화 성능을 입증했습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.