멀티모달 모델 Visual Salamandra 공개
Visual Salamandra: Pushing the Boundaries of Multimodal Understanding
·2025.04.11 23:21
핵심 내용
70억 파라미터 규모의 멀티모달 모델 Visual Salamandra가 이미지와 비디오 이해 능력을 갖춰 공개되었다.
1 / 2
자세히 보기
Language Technologies Lab에서 이미지와 비디오를 모두 처리할 수 있는 Visual Salamandra를 출시했다. 이 모델은 7B(70억) 파라미터 규모의 Salamandra Instructed 모델을 기반으로 하며, 효율성을 유지하면서 멀티모달 기능을 확장했다.
주요 기술적 특징:
- SigLIP-So400m 인코더와 2계층 MLP 프로젝터를 결합한 Late-fusion 아키텍처 사용.
- 이미지 임베딩을 LLM의 잠재 공간(Latent Space)에 정렬하기 위한 4단계 학습 프로세스 적용.
- 610만 개의 인스트럭션 튜닝 인스턴스를 활용하여 시각적 근거(Visual Grounding), 문서 이해, 수학적 추론 능력을 강화.
주요 기능 및 응용 분야:
- VQA (Visual Question Answering): 이미지 및 비디오 기반 질의응답.
- OCR 및 문서 이해: 차트, 도표, 복잡한 문서의 텍스트 추출 및 분석.
- 수학적 추론: 시각적 정보가 포함된 수학 문제 해결.
- 비디오 처리: 비디오 요약 및 이벤트 감지 기능 지원.
특히 이 모델은 유럽 언어의 다양성을 고려한 멀티링구얼(Multilingual) 학습에 집중하여, 기존 멀티모달 모델의 언어적 자원 격차를 해소하는 데 기여한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.