Pixtral 12B 공개
·2024.09.17 09:00
핵심 내용
Mistral AI가 텍스트 성능을 유지하며 강력한 멀티모달 추론 능력을 갖춘 Pixtral 12B를 공개했다.
1 / 2
자세히 보기
Pixtral 12B는 텍스트와 이미지를 함께 학습한 네이티브 멀티모달 모델로, Mistral Nemo 12B를 대체할 수 있도록 설계되었다.
이 모델은 처음부터 학습된 400M 파라미터 비전 인코더와 12B 파라미터 멀티모달 디코더를 결합한 구조를 가진다. 다양한 이미지 크기와 종횡비를 지원하며, 128K 토큰의 긴 컨텍스트 창을 통해 여러 장의 이미지를 동시에 처리할 수 있는 유연성을 제공한다.
주요 성능 및 특징은 다음과 같다:
- **MMMU 추론 벤치마크 52.5%**를 기록하며 다수의 대규모 모델을 능가한다.
- 차트 및 도표 이해, 문서 질의응답, 멀티모달 추론 및 지시 이행(Instruction Following) 능력이 뛰어나다.
- 멀티모달 성능을 높이면서도 코딩, 수학 등 기존 텍스트 전용 벤치마크 성능을 희생하지 않는다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.