AI Briefing

Qwen3: 더 깊게 생각하고 더 빠르게 행동하기

·2025.04.29 05:00

핵심 내용

Qwen3는 하이브리드 thinking mode와 119개 언어 지원을 갖춘 오픈 웨이트 모델이다.

1 / 2

자세히 보기

Qwen3는 Qwen 계열의 최신 대형 언어 모델로, thinking mode와 non-thinking mode를 함께 제공하는 하이브리드 구조가 핵심이다. 복잡한 문제는 단계적으로 추론하고, 단순한 질문은 빠르게 응답하도록 설계해 추론 예산을 유연하게 조절할 수 있다.

가장 큰 모델인 Qwen3-235B-A22B는 코드, 수학, 일반 능력 벤치마크에서 DeepSeek-R1, o1, o3-mini, Grok-3, Gemini-2.5-Pro 같은 상위 모델들과 경쟁할 만한 성능을 보인다고 소개된다. 함께 공개된 Qwen3-30B-A3B는 10배 더 많은 활성 파라미터를 쓰는 QwQ-32B를 능가하며, Qwen3-4B는 Qwen2.5-72B-Instruct 수준에 맞먹는다고 설명한다.

공개된 모델은 두 개의 MoE와 여섯 개의 dense 모델로 구성된다.

  • MoE: Qwen3-235B-A22B(총 235B, 활성 22B), Qwen3-30B-A3B(총 30B, 활성 3B)
  • Dense: Qwen3-32B, 14B, 8B, 4B, 1.7B, 0.6B
  • 라이선스: Apache 2.0
  • 컨텍스트 길이: dense 소형 모델은 32K, 그 외 대부분은 128K

멀티링구얼 측면에서는 119개 언어와 방언을 지원한다. 영어, 중국어, 아랍어, 한국어, 일본어를 포함해 다양한 언어권을 포괄하며, 국제 서비스와 다국어 애플리케이션에 맞게 확장성을 강조한다.

에이전트 능력도 강화됐다. coding과 agentic 작업에 최적화했고, MCP 지원도 강화했다고 밝힌다. 배포는 SGLang과 vLLM을 권장하며, 로컬 실행용으로는 Ollama, LMStudio, MLX, llama.cpp, KTransformers를 제안한다.

사전학습 규모는 Qwen2.5의 18T tokens에서 거의 두 배인 약 36T tokens로 확대됐다. 데이터는 웹뿐 아니라 PDF-like 문서까지 포함했고, Qwen2.5-VL로 텍스트를 추출한 뒤 Qwen2.5로 품질을 높였으며, 수학과 코드 데이터는 Qwen2.5-Math와 Qwen2.5-Coder로 합성했다.

프리트레이닝은 세 단계로 진행됐다.

  • S1: 4K context로 30T+ tokens 학습, 기본 언어 능력과 상식 확보
  • S2: STEM, coding, reasoning 비중을 늘려 5T tokens 추가 학습
  • 최종 단계: 고품질 long-context 데이터로 32K context 확장

포스트트레이닝은 네 단계 파이프라인으로 정리된다. long CoT cold start, reasoning-based RL, thinking mode fusion, general RL 순서로 진행하며, 수학·코딩·논리·STEM 문제부터 instruction following, format following, agent 능력까지 폭넓게 다듬는다.

개발 예시에서는 Hugging Face transformers로 모델을 불러와 enable_thinking=True/False로 모드를 전환하는 방법을 보여준다. 추가로 /think, /no_think를 프롬프트나 system message에 넣어 멀티턴 대화 중에도 사고 모드를 유연하게 바꿀 수 있다고 설명한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.