Meta, 이미지·텍스트 통합하는 가변 길이 연속 토큰 모델 FLAT 공개
핵심 내용
Meta가 이미지와 텍스트를 하나의 연속 토큰 시퀀스로 통합해 이해와 생성을 수행하는 FLAT 모델을 공개했다.
자세히 보기
Meta가 이미지와 텍스트를 하나의 flexible-length continuous token sequence로 매핑하여 이해(understanding)와 생성(generation)을 통합하는 멀티모달 모델 FLAT을 공개했다. 이 모델은 단일 VLM 인코더를 통해 두 모달리티 모두에 대해 최대 256개의 연속적인 64차원 register tokens를 생성한다.
핵심 메커니즘과 성능
FLAT은 nested dropout 기법을 사용해 정보를 coarse-to-fine 방식으로 조직화한다. 추론 시 prefix 길이(K)를 선택함으로써 연산량과 세부 사항 표현 사이의 균형을 조절할 수 있다. 첫 토큰은 전역적 의미(global semantics)를 담당하며, 긴 prefix는 구성 요소와 세밀한 속성을 복원한다. 학습 목표로는 cross-modal alignment, image synthesis, captioning을 joint training으로 수행한다.
주요 성능 지표는 다음과 같다:
- GenEval: 83.1
- COCO CIDEr: 138.6 (BLEU-4: 40.5)
- Retrieval (COCO R@5): I2T 86.8 / T2I 75.8
- ImageNet linear probe: 81.8
확장성과 유연성
FLAT의 가장 큰 특징은 representation width(K) 변화에 따른 성능 안정성이다. COCO 기준 K=1에서 K=256으로 증가해도 성능 변화가 1점 미만으로 거의 일정하며, K=1에서도 경쟁력 있는 성능을 보인다. 반면 생성(Generation) 작업에서는 K가 증가함에 따라 모델 전환 없이 개수, 공간 관계, 속성 등 compositional detail이 점진적으로 해결된다.
또한, FLAT continuous token은 modality gap을 크게 축소한다. 단일 FLAT token은 CLIP의 image-text centroid distance를 절반으로, 전체 sequence는 약 1/4로 감소시킨다. 이러한 공유된 decodable space 덕분에 벡터 연산을 통한 해석 가능한 semantic transition 생성이나, lighthouse와 full moon 같은 semantic 합성이 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.