Qwen2.5-Coder: 더 많은 코딩, 더 많은 학습!
·2024.09.19 01:00
핵심 내용
5.5조 개의 토큰을 학습해 코딩과 수학 능력을 대폭 강화한 차세대 오픈 소스 모델 **Qwen2.5-Coder**가 공개되었다.
1 / 2
자세히 보기
차세대 오픈 소스 코딩 모델인 Qwen2.5-Coder가 출시되었다. 기존 CodeQwen1.5의 후속작으로, 모델 명칭을 Qwen-Coder로 공식 변경하며 더욱 민첩한 코딩 파트너로서의 비전을 제시한다. 모델은 1.5B, 7B 크기로 제공되며, 32B 버전도 출시될 예정이다.
이번 업데이트는 코딩 데이터 스케일링과 수학 및 일반 능력 유지에 집중했다. **5.5조 개(5.5 trillion)**의 토큰(소스 코드, 텍스트-코드 접지 데이터, 합성 데이터 포함)을 학습하여 코딩 관련 작업 성능을 대폭 끌어올렸다. 동시에 수학과 일반 능력을 보강하여 Code Agent와 같은 실무 애플리케이션에 적합한 기반을 마련했다.
Qwen2.5-Coder의 주요 특징은 다음과 같다:
- 광범위한 지원: 최대 128K 컨텍스트 길이를 지원하며, 92개의 프로그래밍 언어를 커버한다.
- 강력한 성능: 오픈 소스 7B 버전은 DeepSeek-Coder-V2-Lite 및 CodeStral-22B와 같은 대형 모델을 능가하는 성능을 보여준다.
- 다재다능한 능력: 코드 생성, 완성, 수정은 물론 GSM8K, MMLU 등 수학 및 일반 벤치마크에서도 경쟁력 있는 성능을 유지한다.
지시어 튜닝을 거친 Qwen2.5-Coder-Instruct 모델은 더욱 뛰어난 범용성을 보여준다. McEval을 통한 다중 언어 평가, CRUXEval 기반의 코드 추론, 그리고 수학적 추론 능력에서 탁월한 성과를 거두며 '과학도'와 같은 면모를 입증했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.