AI Briefing

Qwen2.5: 파운데이션 모델의 향연!

·2024.09.19 01:00

핵심 내용

Alibaba가 18조 개의 토큰으로 학습된 강력한 성능의 Qwen2.5 모델 시리즈를 공개했다.

1 / 2

자세히 보기

Alibaba가 최신 대규모 데이터셋을 기반으로 한 Qwen2.5 모델 시리즈를 공개했다. 이번 릴리스에는 범용 언어 모델인 Qwen2.5를 비롯해 코딩 특화 모델인 Qwen2.5-Coder, 수학 특화 모델인 Qwen2.5-Math가 포함된다.

Qwen2.5 LLM은 최대 18조(18T) 개의 토큰으로 사전 학습되었으며, 이전 버전인 Qwen2 대비 지식량과 코딩, 수학 능력이 대폭 향상되었다. 주요 특징은 다음과 같다:

  • 성능 향상: MMLU 85+, HumanEval 85+, MATH 80+ 달성
  • 확장성: 최대 128K 컨텍스트 지원 및 8K 토큰 생성 가능
  • 다국어 지원: 한국어를 포함한 29개 이상의 언어 지원
  • 구조화된 출력: JSON 등 구조화된 데이터 이해 및 생성 능력 강화

특화 모델인 Qwen2.5-Coder는 5.5조 개의 코드 데이터를 학습하여 소형 모델임에도 강력한 성능을 제공하며, Qwen2.5-Math는 Chain-of-Thought(CoT), Program-of-Thought(PoT) 등 다양한 추론 방식을 통합했다.

가장 큰 모델인 Qwen2.5-72B는 Llama-3.1-70B 및 Mistral-Large-V2와 대등한 성능을 보이며, 베이스 모델의 경우 Llama-3-405B와 같은 거대 모델과 경쟁할 수 있는 수준의 성능을 기록했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.