이미지 세트로부터 시각 개념 추론하기
·2026.07.17 09:00
Vision-Language Model이 이미지 예시로부터 시각 개념을 추론하고 적용하는 VICIS 모델이 제안됐다.
현재 **Vision-Language Model(VLM)**은 복잡한 텍스트 명령을 따르지만, 순수 시각 정보로부터의 추론에는 약하다. 특히 이미지 세트에서 공유하는 개념을 파악하고 새로운 입력에 적용하는 데 실패한다.
연구팀은 이 능력을 평가하기 위해 VICIS(Visual Concept Inference from Sets) 작업을 정의했다. 특정 개념을 공유하는 문맥 이미지 세트와 쿼리 이미지가 주어질 때, 모델은 문맥에서 정의된 개념을 유지하면서도 쿼리와 일치하는 새로운 이미지를 생성해야 한다.
SOTA VLM들을 평가한 결과 성능이 저조했다. 시각 문맥을 무시하거나 편향된 생성을 기본값으로 하는 경향을 보였다.
이를 해결하기 위해 연구팀은 이미지 세트로부터 시각 개념을 추론하고 개념별 임베딩을 추출하는 학습 프레임워크와 아키텍처를 제안했다. 합성 데이터와 ImageNet/WordNet 대규모 데이터 실험에서 제안 모델은 더 정확하고 다양한 출력을 생성했으며, 보지 못한 개념과 스케치 같은 새로운 모달리티로도 일반화되는 것을 확인했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.