AI Briefing

Qwen1.5-110B: Qwen1.5 시리즈의 첫 100B+ 모델

·2024.04.25 14:33

Qwen 팀이 Llama-3-70B와 대등한 성능을 갖춘 100B 규모의 Qwen1.5-110B 모델을 공개했다.

Qwen 팀이 Qwen1.5 시리즈 중 처음으로 1,000억 개 이상의 파라미터를 보유한 Qwen1.5-110B 모델을 출시했다. 이 모델은 베이스 모델 평가에서 Meta-Llama3-70B와 대등한 성능을 보이며, MT-BenchAlpacaEval 2.0과 같은 채팅 평가에서도 뛰어난 성과를 기록했다.

Qwen1.5-110B는 기존 Qwen1.5 모델과 동일한 Transformer decoder 아키텍처를 기반으로 구축되었다. 주요 특징은 다음과 같다.

  • Grouped Query Attention (GQA) 적용으로 효율적인 모델 서빙 지원
  • 최대 32K 토큰의 컨텍스트 길이 지원
  • 한국어, 영어, 중국어, 일본어 등을 포함한 광범위한 다국어 지원

벤치마크 결과에 따르면, 110B 모델은 MMLU, GSM8K, HumanEval 등 주요 지표에서 Llama-3-70BMixtral-8x22B와 경쟁할 만한 수준의 성능을 보여준다. 특히 기존 72B 모델과 비교했을 때, 모델 크기 확장에 따른 성능 향상이 뚜렷하게 나타났다.

채팅 모델 성능에서도 기존 72B 모델보다 유의미한 발전을 이루었다. 이는 포스트 트레이닝(post-training) 방식을 크게 변경하지 않더라도, 더 강력하고 거대한 베이스 모델이 더 우수한 채팅 모델로 이어질 수 있음을 시사한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.