Qwen3.7-Max: agent frontier
·2026.05.21 09:33
Qwen3.7-Max가 코딩·추론·에이전트 벤치마크에서 상위권 성능을 보였다.
Alibaba의 Qwen3.7-Max가 에이전트 중심 독점 모델로 공개됐다. 코딩, 사무 자동화, 장기 자율 실행을 겨냥하며, 여러 벤치마크에서 경쟁 모델들과 직접 비교됐다.
주요 성능은 다음과 같다.
- Terminal Bench 2.0-Terminus 69.7점으로 DS-V4-Pro Max를 상회했다.
- GPQA Diamond 92.4점으로 추론 성능도 강했다.
- MCP-Mark 60.8점, MCP-Atlas 76.4점, SpreadSheetBench-v1 87.0점 등 범용 에이전트와 오피스 자동화에서도 높은 점수를 기록했다.
- 다국어 평가인 WMT24++ 85.8점, MAXIFE 89.2점도 제시됐다.
학습과 평가 방식은 단순 점수 경쟁보다 일반화된 에이전트 역량에 초점이 맞춰져 있다.
- 학습 인스턴스를 Task / Harness / Verifier로 분리해, 서로 다른 하네스와 검증자 조합에서도 잘 동작하도록 학습했다.
- 벤치마크들은 학습에 포함되지 않은 out-of-domain 환경으로 구성됐다고 설명한다.
- 특정 하네스의 지름길보다 일반화 가능한 문제 해결 전략을 유도했다고 주장한다.
가장 눈에 띄는 사례는 실제 환경에서의 장기 자율 최적화다.
- 학습 중 본 적 없는 T-Head ZW-M890 PPU 환경에서 SGLang의 Extend Attention 커널을 35시간 동안 자율 최적화했다.
- 이 과정에서 1,158회 도구 호출, 432회 평가를 수행했고, 최종적으로 Triton 대비 기하평균 10.0배 속도 향상을 달성했다고 밝혔다.
- 커널 재설계, 병목 분석, 정합성 수정, 메모리 최적화 등을 모델이 연속적으로 수행했다.
또한 보상 해킹 탐지와 장기 계획형 업무에서도 활용 가능성을 강조했다.
- RL 모니터링 과정에서 1,618건의 해킹 케이스를 플래그하고, 13개의 새 휴리스틱 규칙을 추가했다고 설명했다.
- YC-Bench에서는 스타트업 1년 시뮬레이션에서 총매출 208만 달러를 기록했다고 제시했다.
배포 측면에서는 곧 Alibaba Cloud Model Studio를 통해 API가 제공될 예정이며, Claude Code, OpenClaw, Qwen Code 등과의 통합 방법도 함께 안내했다. 에이전트, 코딩 어시스턴트, 사무 자동화, 로봇 내비게이션까지 포괄하는 범용 AI 에이전트 모델로 포지셔닝한 발표다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.