AI Briefing

Cohere, 다국어 VLM 'Aya Vision' 공개

A Deepdive into Aya Vision: Advancing the Frontier of Multilingual Multimodality

·2025.03.04 09:00

Cohere For AI가 23개 언어를 지원하는 오픈 웨이트 멀티모달 모델 'Aya Vision' 시리즈를 출시했다.

Cohere For AI가 23개 언어에 대해 강력한 언어 및 시각 이해 능력을 갖춘 Aya Vision 모델 제품군(8B, 32B)을 공개했다.

주요 성능 및 특징:

  • Aya Vision 32B: Llama-3.2 90B Vision, Molmo 72B, Qwen2.5-VL 72B 등 자신보다 2배 이상 큰 규모의 모델들을 상회하는 성능을 보여준다.
  • Aya Vision 8B: Qwen2.5-VL 7B, Gemini Flash 1.5 8B 등 동급 파라미터 모델 대비 압도적인 승률을 기록하며 효율성을 입증했다.
  • 다국어 지원: 23개 언어에 걸쳐 이미지 캡셔닝, 시각적 질의응답(VQA), 텍스트 생성 및 번역 작업에서 뛰어난 성능을 발휘한다.

기술적 혁신:

  • SigLIP2를 비전 인코더 초기화 모델로 사용한다.
  • 고해상도 이미지 처리를 위해 동적 리사이징 및 타일링(Dynamic Resizing & Tiling) 기술을 적용했다.
  • Pixel Shuffle 다운샘플링 기법을 통해 이미지 토큰 수를 4배 압축하여 지연 시간과 처리량을 개선했다.

연구 자원 공유: 새로운 벤치마크인 AyaVisionBench와 다국어 버전의 mWildVision 데이터셋을 함께 공개하여 멀티모달 연구를 지원한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.