AI Briefing

HuggingFace, IDEFICS 공개

Introducing IDEFICS: An Open Reproduction of State-of-the-art Visual Langage Model

·2023.08.22 09:00

핵심 내용

HuggingFace가 Flamingo를 오픈 소스로 재현한 멀티모달 모델 IDEFICS를 공개했다.

1 / 2

자세히 보기

HuggingFace가 DeepMind의 Flamingo를 기반으로 한 오픈 액세스 시각 언어 모델(VLM)인 IDEFICS를 출시했다. 이 모델은 텍스트와 이미지가 혼합된 임의의 시퀀스를 입력받아 텍스트를 생성할 수 있으며, GPT-4와 유사한 멀티모달 능력을 갖추고 있다.

주요 특징은 다음과 같다:

  • 두 가지 모델 규모: 9B 및 80B 파라미터 규모의 베이스(Base) 버전과 인스트럭트(Instruct) 버전을 제공한다.
  • 데이터 투명성: Wikipedia, LAION 등 공개 데이터와 함께 HuggingFace가 직접 구축한 115B 토큰 규모의 OBELICS 데이터셋을 사용하여 학습되었다.
  • 오픈 소스 지향: 폐쇄적인 최첨단 모델을 공개 데이터와 모델(LLaMA v1, OpenCLIP)만으로 재현하여 AI 연구의 투명성을 높이는 것을 목표로 한다.

IDEFICS는 이미지 질문 답변, 시각적 콘텐츠 설명, 여러 이미지를 기반으로 한 스토리 생성 등의 작업에서 뛰어난 성능을 보인다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.