Qwen2를 소개합니다
·2024.06.07 01:00
Qwen이 성능과 다국어 능력을 대폭 강화한 차세대 모델 Qwen2를 공개했다.
Qwen1.5에서 진화한 Qwen2가 공개되었다. 이번 시리즈는 0.5B, 1.5B, 7B, 57B-A14B, 72B 등 총 5가지 크기의 사전 학습(Pretrained) 및 지시 미세 조정(Instruction-tuned) 모델을 제공한다.
주요 특징은 다음과 같다:
- 다국어 역량 강화: 영어와 중국어 외에 한국어, 일본어를 포함한 27개 언어를 추가로 학습하여 다국어 능력을 높였다.
- 성능 향상: 코딩 및 수학 분야의 성능이 크게 개선되었으며, 다수의 벤치마크에서 SOTA 성능을 기록했다.
- 긴 컨텍스트 지원: Qwen2-7B-Instruct 및 72B-Instruct 모델은 최대 128K 토큰의 컨텍스트 길이를 지원한다.
기술적으로는 모든 모델 크기에 **GQA(Group Query Attention)**를 적용하여 추론 속도를 높이고 메모리 사용량을 최적화했다. 소형 모델의 경우 파라미터 효율성을 위해 Tie Embedding을 활용한다.
특히 Qwen2-72B는 자연어 이해, 지식 습득, 코딩, 수학 등 다양한 영역에서 Llama-3-70B를 능가하는 성능을 보여주었으며, 이전 모델인 Qwen1.5-110B보다 적은 파라미터로도 더 뛰어난 성능을 달성했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.