AI Briefing

Qwen 시리즈 소개

·2024.01.23 23:13

AGI를 목표로 하는 **Qwen** 시리즈가 공개되었으며, 다양한 크기의 오픈소스 **LLM**과 **LMM**을 포함한다.

Qwen은 단순한 언어 모델을 넘어 AGI(인공 일반 지능)를 지향하는 프로젝트로, LLM(대규모 언어 모델)과 LMM(대규모 멀티모달 모델)을 모두 아우른다. 기본 모델인 Qwen을 바탕으로 채팅 모델인 Qwen-Chat, 코딩 특화 Code-Qwen, 수학 특화 Math-Qwen, 그리고 시각 및 오디오 모델인 Qwen-VLQwen-Audio로 구성된다.

현재 1.8B, 7B, 14B, 72B 등 다양한 크기의 모델이 공개되었으며, 이 중 4종이 오픈소스로 제공된다. 모든 모델은 **2~3조 개(Trillion)**의 토큰으로 사전 학습되었으며, 영어와 중국어에 강력한 성능을 보이면서도 다양한 언어를 지원하는 멀티링구얼 모델이다.

주요 특징은 다음과 같다:

  • 대부분의 오픈소스 모델이 32K의 확장된 컨텍스트 길이를 지원한다.
  • 높은 압축률을 가진 효율적인 Tokenizer를 사용한다.
  • Qwen-72BLlama 2, GPT-3.5, GPT-4와 경쟁할 만한 성능을 보여준다.

사전 학습 이후에는 SFT(지도 미세 조정)와 RLHF(인간 피드백 기반 강화 학습)를 통한 Alignment(정렬) 과정을 거쳐 고품질의 채팅 모델을 구축한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.