CO₂Jump, 합성 생성 시 텍스트-이미지 일관성 개선
Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes [R]
핵심 내용
CO₂Jump는 추가 학습 없이 디노이징 단계당 한 번의 추론으로 텍스트와 이미지 일관성을 높인다.
자세히 보기
Google, Google DeepMind, Stony Brook University 연구진이 합성 텍스트-이미지 생성 시 불일치를 해결하는 샘플러 CO₂Jump를 공개했습니다. 이 방법은 모델이 정답을 텍스트로 설명하면서도 시각적으로 모순되는 이미지를 생성하는 문제를 해결합니다.
작동 원리
CO₂Jump는 샘플링 과정에서 텍스트 신뢰도와 교차 모달 어텐션을 활용해 이미지 업데이트를 유도합니다. 신뢰도가 낮은 토큰을 마스킹하고 재생성하여 생성이 진행됨에 따라 이전 결정을 수정할 수 있게 합니다. 이 샘플러는 디노이징 단계당 모델 순방향 패스 1회로 작동하며, 추가 학습이 필요 없습니다. 대신 작업별로 미세 조정된 모델을 활용합니다.
평가 및 결과
연구진은 이미지 편집, 미로 풀이, 논노그램 과제에서 CO₂Jump를 평가했으며, JEdit-1M, JMaze-200K, JNono-200K 등 세 가지 새로운 데이터셋을 도입했습니다. 퍼즐 벤치마크에서는 텍스트 답변과 생성된 이미지가 모두 정확해야 성공으로 간주됩니다. 8~512 샘플링 단계 전반에서 CO₂Jump는 편집 품질과 그라운딩 모두에서 단조적인 개선을 보인 유일한 비교 샘플러였습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.