AI Briefing

Salesforce, 시각-언어 모델 BLIP-2 공개

Zero-shot image-to-text generation with BLIP-2

·2023.02.15 09:00

고정된 이미지 인코더와 LLM을 연결하는 Q-Former를 통해 효율적인 시각-언어 학습을 구현한 BLIP-2를 소개한다.

Salesforce Research에서 개발한 BLIP-2는 기존의 막대한 비용이 드는 엔드투엔드(end-to-end) 사전 학습 방식에서 벗어나, 고정된(frozen) 이미지 인코더고정된 대규모 언어 모델(LLM) 사이를 연결하는 가벼운 **Q-Former(Querying Transformer)**를 도입한 새로운 패러다임을 제시한다.

Q-Former의 핵심 구조 및 작동 방식:

  • 모달리티 격차 해소: 이미지 인코더로부터 시각적 특징을 추출하고, 이를 언어 모델이 이해할 수 있는 형태로 변환하는 가교 역할을 수행한다.
  • 효율적인 학습: 이미지 인코더와 LLM은 학습시키지 않고 오직 Q-Former만 학습시키므로, 학습 파라미터 수와 사전 학습 비용을 획기적으로 절감할 수 있다.
  • 두 단계의 사전 학습: 이미지-텍스트 대조 학습(Contrastive loss), 이미지 기반 텍스트 생성(Grounded text generation), 이미지-텍스트 매칭(Matching loss)을 통해 최적화된다.

BLIP-2는 이미지 캡셔닝, 시각적 질의응답(VQA), 대화형 프롬프팅 등 다양한 멀티모달 작업에서 최첨단(SOTA) 성능을 보여주며, 현재 Hugging Face Transformers 라이브러리를 통해 즉시 사용 가능하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.