Qwen2.5: 파운데이션 모델의 향연!
·2024.09.19 01:00
핵심 내용
Alibaba가 18조 개의 토큰으로 학습된 강력한 성능의 Qwen2.5 모델 시리즈를 공개했다.
1 / 2
자세히 보기
Alibaba가 최신 대규모 데이터셋을 기반으로 한 Qwen2.5 모델 시리즈를 공개했다. 이번 릴리스에는 범용 언어 모델인 Qwen2.5를 비롯해 코딩 특화 모델인 Qwen2.5-Coder, 수학 특화 모델인 Qwen2.5-Math가 포함된다.
Qwen2.5 LLM은 최대 18조(18T) 개의 토큰으로 사전 학습되었으며, 이전 버전인 Qwen2 대비 지식량과 코딩, 수학 능력이 대폭 향상되었다. 주요 특징은 다음과 같다:
- 성능 향상: MMLU 85+, HumanEval 85+, MATH 80+ 달성
- 확장성: 최대 128K 컨텍스트 지원 및 8K 토큰 생성 가능
- 다국어 지원: 한국어를 포함한 29개 이상의 언어 지원
- 구조화된 출력: JSON 등 구조화된 데이터 이해 및 생성 능력 강화
특화 모델인 Qwen2.5-Coder는 5.5조 개의 코드 데이터를 학습하여 소형 모델임에도 강력한 성능을 제공하며, Qwen2.5-Math는 Chain-of-Thought(CoT), Program-of-Thought(PoT) 등 다양한 추론 방식을 통합했다.
가장 큰 모델인 Qwen2.5-72B는 Llama-3.1-70B 및 Mistral-Large-V2와 대등한 성능을 보이며, 베이스 모델의 경우 Llama-3-405B와 같은 거대 모델과 경쟁할 수 있는 수준의 성능을 기록했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.