AI Briefing

텍스트를 활용한 시각적 표현 정착을 통한 도메인 일반화 연구 - LG AI Research

·2026.07.16 09:00

인간의 언어적 설명을 활용해 이미지 도메인이 바뀌어도 성능을 유지하는 도메인 일반화(DG) 기술을 제안했다.

기존 기계학습 모델은 학습 데이터와 테스트 데이터의 분포가 다를 경우 성능이 급격히 하락하는 도메인 일반화(Domain Generalization, DG) 문제에 취약합니다. 이를 해결하기 위해 본 연구는 인간의 언어적 설명을 활용하는 Natural Language Supervision 방식을 제안합니다.

핵심은 모델이 이미지의 핵심 의미를 파악하도록 돕는 두 가지 모듈입니다.

  • Visual and Textual Joint Embedder: 이미지로부터 추출한 시각적 표현형을 문장의 의미와 정렬(Alignment)하여, 도메인 변화에 무관한 핵심 특징을 학습합니다.
  • Textual Explanation Generator: 모델의 결정 근거를 시각적 단서에 기반한 문장으로 생성하여 학습을 정착시킵니다.

이 방법론은 학습 단계에서 모델을 정착시키는 데 사용되며, 테스트 단계에서는 불필요하지만 원할 경우 결정 근거를 설명하는 용도로 활용할 수 있습니다. 연구 결과, 자체 구축한 CUB-DG 데이터셋과 DomainBed 벤치마크 모두에서 SOTA(State-of-the-art) 성능을 달성하며 뛰어난 일반화 성능을 입증했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.