AI Briefing

Mistral 7B

·2023.09.27 09:00

Mistral AI가 Llama 2 13B를 능가하는 성능을 가진 7.3B 파라미터 규모의 Mistral 7B를 Apache 2.0 라이선스로 공개했다.

Mistral AI가 자사 규모 대비 가장 강력한 언어 모델인 Mistral 7B를 출시했다. 이 모델은 7.3B 파라미터 규모임에도 불구하고 모든 벤치마크에서 Llama 2 13B를 능가하며, 많은 지표에서 Llama 1 34B에 근접하는 성능을 보여준다.

주요 기술적 특징은 다음과 같다:

  • **Grouped-query attention (GQA)**를 적용해 추론 속도를 높였다.
  • **Sliding Window Attention (SWA)**를 통해 더 적은 비용으로 긴 시퀀스를 처리할 수 있다.

Mistral 7B는 Apache 2.0 라이선스로 제공되어 제한 없이 사용할 수 있다. 또한 미세 조정(Fine-tuning)이 용이하며, Llama 2 13B Chat 모델보다 뛰어난 성능을 보이는 채팅용 모델도 함께 제공된다.

효율성 측면에서도 탁월하다. 추론 및 STEM 분야(MMLU 등)에서 Mistral 7B는 기존 Llama 2 모델 중 자기보다 3배 이상 큰 모델과 대등한 성능을 내며, 이를 통해 메모리 절약과 처리량(Throughput) 향상을 동시에 달성했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.