AI Briefing

Mixtral 전문가 모델

·2023.12.11 09:00

핵심 내용

Mistral AI가 Llama 2 70B를 능가하는 성능의 오픈 웨이트 모델 Mixtral 8x7B를 공개했다.

1 / 2

자세히 보기

Mistral AI가 고성능 Sparse Mixture-of-Experts (SMoE) 모델인 Mixtral 8x7B를 공개했다. Apache 2.0 라이선스로 배포되는 이 모델은 대부분의 벤치마크에서 Llama 2 70B를 능가하며, GPT-3.5와 대등하거나 더 높은 성능을 보여준다.

Mixtral은 46.7B개의 전체 파라미터를 갖추고 있지만, 토큰당으로는 12.9B개의 파라미터만 사용하는 효율적인 구조를 가진다. 각 레이어의 라우터 네트워크가 8개의 전문가 그룹 중 2개를 선택해 처리함으로써, 12.9B 모델과 동일한 속도와 비용으로 높은 성능을 구현한다.

주요 역량은 다음과 같다:

  • 32k 토큰 컨텍스트 처리
  • 영어, 프랑스어, 이탈리아어, 독일어, 스페인어 지원
  • 우수한 코드 생성 능력
  • MT-Bench 점수 8.3을 달성하는 지시 이행(Instruction-following) 미세 조정 가능

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.