AI Briefing

Meta, 이미지·텍스트 통합하는 가변 길이 연속 토큰 모델 FLAT 공개

·2026.09.17 09:00

핵심 내용

Meta가 이미지와 텍스트를 하나의 연속 토큰 시퀀스로 통합해 이해와 생성을 수행하는 FLAT 모델을 공개했다.

1 / 13

자세히 보기

Meta가 이미지와 텍스트를 하나의 flexible-length continuous token sequence로 매핑하여 이해(understanding)와 생성(generation)을 통합하는 멀티모달 모델 FLAT을 공개했다. 이 모델은 단일 VLM 인코더를 통해 두 모달리티 모두에 대해 최대 256개의 연속적인 64차원 register tokens를 생성한다.

핵심 메커니즘과 성능

FLAT은 nested dropout 기법을 사용해 정보를 coarse-to-fine 방식으로 조직화한다. 추론 시 prefix 길이(K)를 선택함으로써 연산량과 세부 사항 표현 사이의 균형을 조절할 수 있다. 첫 토큰은 전역적 의미(global semantics)를 담당하며, 긴 prefix는 구성 요소와 세밀한 속성을 복원한다. 학습 목표로는 cross-modal alignment, image synthesis, captioning을 joint training으로 수행한다.

주요 성능 지표는 다음과 같다:

  • GenEval: 83.1
  • COCO CIDEr: 138.6 (BLEU-4: 40.5)
  • Retrieval (COCO R@5): I2T 86.8 / T2I 75.8
  • ImageNet linear probe: 81.8

확장성과 유연성

FLAT의 가장 큰 특징은 representation width(K) 변화에 따른 성능 안정성이다. COCO 기준 K=1에서 K=256으로 증가해도 성능 변화가 1점 미만으로 거의 일정하며, K=1에서도 경쟁력 있는 성능을 보인다. 반면 생성(Generation) 작업에서는 K가 증가함에 따라 모델 전환 없이 개수, 공간 관계, 속성 등 compositional detail이 점진적으로 해결된다.

또한, FLAT continuous token은 modality gap을 크게 축소한다. 단일 FLAT token은 CLIP의 image-text centroid distance를 절반으로, 전체 sequence는 약 1/4로 감소시킨다. 이러한 공유된 decodable space 덕분에 벡터 연산을 통한 해석 가능한 semantic transition 생성이나, lighthouse와 full moon 같은 semantic 합성이 가능하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.