AI Briefing

Florence-2, DocVQA 미세 조정 가이드

Fine-tuning Florence-2 - Microsoft's Cutting-edge Vision Language Models

·2024.06.24 09:00

Microsoft의 소형 시각 언어 모델 Florence-2를 DocVQA 작업에 맞춰 미세 조정하는 방법과 성능 결과를 소개한다.

Microsoft의 Florence-2는 0.2B 및 0.7B 규모의 소형 모델임에도 불구하고 캡셔닝, 객체 탐지, OCR 등 다양한 시각 작업에서 뛰어난 성능을 보이는 기초 시각 언어 모델(VLM)이다.

이 모델은 DaViT 비전 인코더와 BERT 텍스트 인코더를 사용하는 인코더-디코더 아키텍처를 기반으로 하며, 1억 2,600만 개의 이미지와 50억 개 이상의 주석이 담긴 FLD-5B 데이터셋으로 사전 학습되었다.

기존 모델에 포함되지 않은 VQA(시각적 질의응답) 기능을 구현하기 위해 DocVQA 데이터셋을 활용하여 미세 조정을 진행한 결과, Levenshtein 유사도 점수가 0에서 57.0으로 크게 향상되었다.

실험은 단일 A100 또는 T4 GPU와 같은 제한된 컴퓨팅 자원 환경에서도 수행 가능함을 확인했으며, 관련 코드와 데모는 GitHub 및 Hugging Face를 통해 공개되어 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.