HuggingFace, IDEFICS 공개
Introducing IDEFICS: An Open Reproduction of State-of-the-art Visual Langage Model
·2023.08.22 09:00
핵심 내용
HuggingFace가 Flamingo를 오픈 소스로 재현한 멀티모달 모델 IDEFICS를 공개했다.
1 / 2
자세히 보기
HuggingFace가 DeepMind의 Flamingo를 기반으로 한 오픈 액세스 시각 언어 모델(VLM)인 IDEFICS를 출시했다. 이 모델은 텍스트와 이미지가 혼합된 임의의 시퀀스를 입력받아 텍스트를 생성할 수 있으며, GPT-4와 유사한 멀티모달 능력을 갖추고 있다.
주요 특징은 다음과 같다:
- 두 가지 모델 규모: 9B 및 80B 파라미터 규모의 베이스(Base) 버전과 인스트럭트(Instruct) 버전을 제공한다.
- 데이터 투명성: Wikipedia, LAION 등 공개 데이터와 함께 HuggingFace가 직접 구축한 115B 토큰 규모의 OBELICS 데이터셋을 사용하여 학습되었다.
- 오픈 소스 지향: 폐쇄적인 최첨단 모델을 공개 데이터와 모델(LLaMA v1, OpenCLIP)만으로 재현하여 AI 연구의 투명성을 높이는 것을 목표로 한다.
IDEFICS는 이미지 질문 답변, 시각적 콘텐츠 설명, 여러 이미지를 기반으로 한 스토리 생성 등의 작업에서 뛰어난 성능을 보인다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.