Mixtral 전문가 모델
·2023.12.11 09:00
핵심 내용
Mistral AI가 Llama 2 70B를 능가하는 성능의 오픈 웨이트 모델 Mixtral 8x7B를 공개했다.
1 / 2
자세히 보기
Mistral AI가 고성능 Sparse Mixture-of-Experts (SMoE) 모델인 Mixtral 8x7B를 공개했다. Apache 2.0 라이선스로 배포되는 이 모델은 대부분의 벤치마크에서 Llama 2 70B를 능가하며, GPT-3.5와 대등하거나 더 높은 성능을 보여준다.
Mixtral은 46.7B개의 전체 파라미터를 갖추고 있지만, 토큰당으로는 12.9B개의 파라미터만 사용하는 효율적인 구조를 가진다. 각 레이어의 라우터 네트워크가 8개의 전문가 그룹 중 2개를 선택해 처리함으로써, 12.9B 모델과 동일한 속도와 비용으로 높은 성능을 구현한다.
주요 역량은 다음과 같다:
- 32k 토큰 컨텍스트 처리
- 영어, 프랑스어, 이탈리아어, 독일어, 스페인어 지원
- 우수한 코드 생성 능력
- MT-Bench 점수 8.3을 달성하는 지시 이행(Instruction-following) 미세 조정 가능
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.