AI Briefing

Mistral, Mixtral 8x7b 공개

Welcome Mixtral - a SOTA Mixture of Experts on Hugging Face

·2023.12.11 09:00

Mistral AI의 새로운 MoE 모델 Mixtral 8x7b가 공개되었으며, GPT-3.5를 능가하는 성능을 보여준다.

Mixtral 8x7b는 Mixture of Experts (MoE) 기술을 적용하여 8개의 전문가 모델을 하나로 통합한 모델이다. 각 토큰 처리 시 2개의 전문가만 선택하는 방식을 통해, 실제 파라미터 수는 많음에도 불구하고 12B 파라미터 밀집 모델 수준의 빠른 추론 속도를 구현했다.

주요 특징은 다음과 같다:

  • 32k 컨텍스트 길이 지원
  • Llama 2 70B를 능가하며, 대부분의 벤치마크에서 GPT-3.5와 대등하거나 더 높은 성능 기록
  • 영어, 프랑스어, 독일어, 스페인어, 이탈리아어 지원 및 뛰어난 코딩 능력 (HumanEval 40.2%)
  • Apache 2.0 라이선스로 상업적 이용 가능

Hugging Face는 모델 허브 제공, Inference EndpointsText Generation Inference (TGI) 통합, TRL을 이용한 단일 GPU 파인튜닝, 4-bit 양자화 지원 등 생태계 전반의 통합 기능을 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.