AI Briefing

Qwen 시리즈 소개

·2024.01.23 23:13

핵심 내용

AGI를 목표로 하는 **Qwen** 시리즈가 공개되었으며, 다양한 크기의 오픈소스 **LLM**과 **LMM**을 포함한다.

1 / 2

자세히 보기

Qwen은 단순한 언어 모델을 넘어 AGI(인공 일반 지능)를 지향하는 프로젝트로, LLM(대규모 언어 모델)과 LMM(대규모 멀티모달 모델)을 모두 아우른다. 기본 모델인 Qwen을 바탕으로 채팅 모델인 Qwen-Chat, 코딩 특화 Code-Qwen, 수학 특화 Math-Qwen, 그리고 시각 및 오디오 모델인 Qwen-VL과 Qwen-Audio로 구성된다.

현재 1.8B, 7B, 14B, 72B 등 다양한 크기의 모델이 공개되었으며, 이 중 4종이 오픈소스로 제공된다. 모든 모델은 **2~3조 개(Trillion)**의 토큰으로 사전 학습되었으며, 영어와 중국어에 강력한 성능을 보이면서도 다양한 언어를 지원하는 멀티링구얼 모델이다.

주요 특징은 다음과 같다:

  • 대부분의 오픈소스 모델이 32K의 확장된 컨텍스트 길이를 지원한다.
  • 높은 압축률을 가진 효율적인 Tokenizer를 사용한다.
  • Qwen-72B는 Llama 2, GPT-3.5, GPT-4와 경쟁할 만한 성능을 보여준다.

사전 학습 이후에는 SFT(지도 미세 조정)와 RLHF(인간 피드백 기반 강화 학습)를 통한 Alignment(정렬) 과정을 거쳐 고품질의 채팅 모델을 구축한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.