Pixtral 12B 공개
·2024.09.17 09:00
Mistral AI가 텍스트 성능을 유지하며 강력한 멀티모달 추론 능력을 갖춘 Pixtral 12B를 공개했다.
Pixtral 12B는 텍스트와 이미지를 함께 학습한 네이티브 멀티모달 모델로, Mistral Nemo 12B를 대체할 수 있도록 설계되었다.
이 모델은 처음부터 학습된 400M 파라미터 비전 인코더와 12B 파라미터 멀티모달 디코더를 결합한 구조를 가진다. 다양한 이미지 크기와 종횡비를 지원하며, 128K 토큰의 긴 컨텍스트 창을 통해 여러 장의 이미지를 동시에 처리할 수 있는 유연성을 제공한다.
주요 성능 및 특징은 다음과 같다:
- **MMMU 추론 벤치마크 52.5%**를 기록하며 다수의 대규모 모델을 능가한다.
- 차트 및 도표 이해, 문서 질의응답, 멀티모달 추론 및 지시 이행(Instruction Following) 능력이 뛰어나다.
- 멀티모달 성능을 높이면서도 코딩, 수학 등 기존 텍스트 전용 벤치마크 성능을 희생하지 않는다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.