OFA: One-For-All 모델 구축을 향하여
·2022.11.14 17:01
태스크, 모달리티, 아키텍처를 하나로 통합한 멀티모달 사전 학습 모델 **OFA**를 공개했다.
OFA는 태스크, 모달리티, 아키텍처의 세 가지 차원에서의 통합을 목표로 한다. 모델은 아키텍처 수정 없이 새로운 태스크를 수용하는 Task agnostic, 복잡한 전처리 없이 다양한 입력을 처리하는 Modality agnostic, 그리고 기존 능력을 조합해 미학습 태스크로 전이 가능한 Task comprehensiveness를 지향한다.
모달리티 통합을 위해 이미지와 바운딩 박스를 이산화(discretization)한다. 이미지는 VQ tokens로, 바운딩 박스는 bins로 표현하여 Transformer가 처리할 수 있는 형태로 변환한다. 아키텍처는 T5와 유사한 범용 Transformer encoder-decoder를 채택했으며, 학습 안정성을 위해 Normformer를 도입하고 이미지 입력에는 ResNet 블록을 활용한다.
핵심 혁신은 멀티태스크 학습이다. 모델은 다음과 같은 8가지 태스크를 통해 사전 학습된다:
- Vision-language: visual grounding, grounded captioning, VQA, image-text matching, image captioning
- Vision: detection, image infilling
- Language: text infilling
각 태스크를 구분하기 위해 텍스트 형태의 instruction을 삽입하며, 이를 통해 모델이 학습하지 않은 새로운 태스크에 대해서도 zero-shot generation을 수행할 수 있도록 설계했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.