Qwen3-Max-Thinking의 한계 돌파하기
Qwen3-Max-Thinking은 툴 사용과 test-time scaling으로 추론 성능을 끌어올렸다.
Qwen3-Max-Thinking은 파라미터 확장과 대규모 RL을 통해 지식, 복잡한 추론, instruction following, alignment, agent 능력 전반을 강화한 Qwen의 플래그십 reasoning model이다. 19개 벤치마크에서 GPT-5.2-Thinking, Claude-Opus-4.5, Gemini 3 Pro에 필적하는 성능을 보였고, 핵심 추론 지표에서는 일부 구간에서 Gemini 3 Pro를 넘어섰다.
추가로 두 가지 개선이 들어갔다. Adaptive tool-use는 대화 중 사용자가 도구를 고르지 않아도 Search, Memory, Code Interpreter를 상황에 맞게 자동 활용한다. Search와 Memory는 hallucination을 줄이고 실시간 정보와 개인화 응답을 가능하게 하며, Code Interpreter는 코드 실행과 계산 기반 추론을 돕는다.
벤치마크에서는 MMLU-Pro 85.7, GPQA 87.4, LiveCodeBench v6 85.9, SWE Verified 75.3, Arena-Hard v2 90.2, Tau² Bench 82.1 등을 기록했다. 장문 맥락에서도 AA-LCR 68.7을 보여, 지식·추론·에이전트·툴 사용 전반을 함께 끌어올렸다는 점을 강조한다.
추론 성능 향상을 위해 test-time scaling에는 경험 누적형, 다중 라운드 전략을 적용했다. 단순히 병렬 경로 수 N을 늘리는 대신, 남는 계산량을 반복적 self-reflection에 재배치하고 take-experience 메커니즘으로 이전 라운드의 핵심 통찰만 압축해 다음 라운드에 반영한다. 그 결과 비슷한 토큰 소비로 GPQA 90.3→92.8, HLE 34.1→36.5, LiveCodeBench v6 88.0→91.4, IMO-AnswerBench 89.5→91.5, HLE (w/ tools) 55.8→58.3 개선을 냈다.
실사용 측면에서는 Qwen Chat과 API가 공개됐다. API 이름은 qwen3-max-2026-01-23이며, OpenAI-compatible 방식으로 base_url을 설정해 쓸 수 있고 extra_body의 enable_thinking=True로 thinking 모드를 켤 수 있다.
또한 Anthropic API protocol과도 호환돼 Claude Code와 연동할 수 있다. ANTHROPIC_MODEL, ANTHROPIC_SMALL_FAST_MODEL, ANTHROPIC_BASE_URL, ANTHROPIC_AUTH_TOKEN 환경변수를 설정하면 Qwen3-Max-Thinking을 코드 작업 흐름에 바로 연결할 수 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.