AI Briefing

의미적으로 풍부한 시각 표현 학습을 위한 텍스트 조건형 JEPA

·2026.05.07 09:00

캡션을 조건으로 넣어 의미가 풍부한 시각 표현을 학습하는 TC-JEPA를 제안했다.

기존 I-JEPA는 마스크된 위치의 잠재 특징을 예측하지만, 가려진 영역의 불확실성 때문에 의미 학습이 쉽지 않았다.

TC-JEPA는 이미지 캡션을 조건으로 삼고, 입력 텍스트 토큰에 대한 희소 cross-attention으로 예측 패치 특징을 조정한다. 그 결과 패치 표현이 텍스트에 의해 더 잘 예측돼 더 의미적인 시각 표현을 학습한다.

  • downstream performance, 학습 안정성, 확장성이 모두 개선되거나 유망했다.
  • 특징 예측만으로 학습하는 새로운 vision-language pretraining 패러다임을 제시했다.
  • 특히 세밀한 시각 이해와 추론이 필요한 작업에서 contrastive methods를 앞섰다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.