AI Briefing

LG AI Research 247

·2026.07.16 09:00

자연어 감독(Natural Language Supervision)을 활용해 시각적 표현을 인간의 추론 방식과 정렬함으로써 도메인 일반화(DG) 성능을 높이는 새로운 방법론을 제안한다.

머신러닝 모델은 학습 데이터와 테스트 데이터의 분포가 다를 경우 성능이 급격히 저하되는 도메인 일반화(Domain Generalization, DG) 문제에 직면한다. 예를 들어 도시 환경에서 학습된 자동차 분류 모델은 스케치나 농촌 환경의 이미지에서 제대로 작동하지 않을 수 있다.

본 연구에서는 시각적 표현을 인간의 전형적인 추론이 담긴 텍스트와 결합하는 방식을 제안한다. 단순히 이미지 라벨링에 의존하는 대신, 인간의 사고 과정을 반영한 **텍스트 설명(Textual Explanation)**을 활용해 모델이 더 풍부한 의미론적 정보를 학습하도록 유도한다.

이를 위해 두 가지 핵심 모듈을 도입한다:

  • Visual and Textual Joint Embedder: 시각적 표현을 피벗 문장 임베딩과 정렬한다.
  • Textual Explanation Generator: 결정의 근거가 되는 논리적 이유를 설명하는 텍ย스트를 생성한다.

제안된 방법론은 새롭게 구축된 CUB-DG 데이터셋과 DomainBed 벤치마크 모두에서 최첨단(SOTA) 성능을 달성하며, 도메인 변화에 강한 모델을 구축할 수 있음을 입증했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.