AI Briefing

멀티모달 모델 Visual Salamandra 공개

Visual Salamandra: Pushing the Boundaries of Multimodal Understanding

·2025.04.11 23:21

핵심 내용

70억 파라미터 규모의 멀티모달 모델 Visual Salamandra가 이미지와 비디오 이해 능력을 갖춰 공개되었다.

1 / 2

자세히 보기

Language Technologies Lab에서 이미지와 비디오를 모두 처리할 수 있는 Visual Salamandra를 출시했다. 이 모델은 7B(70억) 파라미터 규모의 Salamandra Instructed 모델을 기반으로 하며, 효율성을 유지하면서 멀티모달 기능을 확장했다.

주요 기술적 특징:

  • SigLIP-So400m 인코더와 2계층 MLP 프로젝터를 결합한 Late-fusion 아키텍처 사용.
  • 이미지 임베딩을 LLM의 잠재 공간(Latent Space)에 정렬하기 위한 4단계 학습 프로세스 적용.
  • 610만 개의 인스트럭션 튜닝 인스턴스를 활용하여 시각적 근거(Visual Grounding), 문서 이해, 수학적 추론 능력을 강화.

주요 기능 및 응용 분야:

  • VQA (Visual Question Answering): 이미지 및 비디오 기반 질의응답.
  • OCR 및 문서 이해: 차트, 도표, 복잡한 문서의 텍스트 추출 및 분석.
  • 수학적 추론: 시각적 정보가 포함된 수학 문제 해결.
  • 비디오 처리: 비디오 요약 및 이벤트 감지 기능 지원.

특히 이 모델은 유럽 언어의 다양성을 고려한 멀티링구얼(Multilingual) 학습에 집중하여, 기존 멀티모달 모델의 언어적 자원 격차를 해소하는 데 기여한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.