AI Briefing

Qwen2.5-LLM: LLM의 경계를 확장하다

·2024.09.19 01:00

핵심 내용

Alibaba가 18조 개의 토큰을 학습해 성능을 대폭 높인 Qwen2.5 시리즈를 공개했다.

자세히 보기

Alibaba가 새로운 Qwen2.5 시리즈를 공개했다. 이번 시리즈는 0.5B부터 72B 파라미터에 이르는 7종의 디코더 전용(decoder-only) 밀집 모델을 포함한다. 특히 생산 환경에 적합한 14B, 32B 모델과 모바일 기기용 3B 모델을 새롭게 추가하여 사용자 요구에 맞춘 라인업을 구축했다.

주요 업그레이드 사항은 다음과 같다:

  • 데이터셋 규모 확대: 사전 학습 데이터셋을 기존 7조 개에서 최대 18조 개의 토큰으로 확장했다.
  • 코딩 및 수학 능력 강화: Qwen2.5-Coder와 Qwen2-math 기술을 통합하여 코딩 및 수학적 추론 성능을 비약적으로 높였다.
  • 지식 및 선호도 향상: MMLU 벤치마크 점수가 상승했으며, Arena-Hard 및 MT-Bench 점수 개선을 통해 인간의 선호도에 더 가까운 응답을 생성한다.

또한 지시 이행(instruction following) 능력과 긴 텍스트 생성(최대 8K 토큰) 능력이 강화되었으며, 대부분의 모델이 128K의 컨텍스트 길이를 지원한다. 표와 같은 구조화된 데이터 이해 및 JSON 출력 생성 능력도 개선되어 실무 활용도를 높였다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.