AI Briefing

Qwen3.7-Max: agent frontier

·2026.05.21 09:33

핵심 내용

Qwen3.7-Max가 코딩·추론·에이전트 벤치마크에서 상위권 성능을 보였다.

자세히 보기

Alibaba의 Qwen3.7-Max가 에이전트 중심 독점 모델로 공개됐다. 코딩, 사무 자동화, 장기 자율 실행을 겨냥하며, 여러 벤치마크에서 경쟁 모델들과 직접 비교됐다.

주요 성능은 다음과 같다.

  • Terminal Bench 2.0-Terminus 69.7점으로 DS-V4-Pro Max를 상회했다.
  • GPQA Diamond 92.4점으로 추론 성능도 강했다.
  • MCP-Mark 60.8점, MCP-Atlas 76.4점, SpreadSheetBench-v1 87.0점 등 범용 에이전트와 오피스 자동화에서도 높은 점수를 기록했다.
  • 다국어 평가인 WMT24++ 85.8점, MAXIFE 89.2점도 제시됐다.

학습과 평가 방식은 단순 점수 경쟁보다 일반화된 에이전트 역량에 초점이 맞춰져 있다.

  • 학습 인스턴스를 Task / Harness / Verifier로 분리해, 서로 다른 하네스와 검증자 조합에서도 잘 동작하도록 학습했다.
  • 벤치마크들은 학습에 포함되지 않은 out-of-domain 환경으로 구성됐다고 설명한다.
  • 특정 하네스의 지름길보다 일반화 가능한 문제 해결 전략을 유도했다고 주장한다.

가장 눈에 띄는 사례는 실제 환경에서의 장기 자율 최적화다.

  • 학습 중 본 적 없는 T-Head ZW-M890 PPU 환경에서 SGLang의 Extend Attention 커널을 35시간 동안 자율 최적화했다.
  • 이 과정에서 1,158회 도구 호출, 432회 평가를 수행했고, 최종적으로 Triton 대비 기하평균 10.0배 속도 향상을 달성했다고 밝혔다.
  • 커널 재설계, 병목 분석, 정합성 수정, 메모리 최적화 등을 모델이 연속적으로 수행했다.

또한 보상 해킹 탐지와 장기 계획형 업무에서도 활용 가능성을 강조했다.

  • RL 모니터링 과정에서 1,618건의 해킹 케이스를 플래그하고, 13개의 새 휴리스틱 규칙을 추가했다고 설명했다.
  • YC-Bench에서는 스타트업 1년 시뮬레이션에서 총매출 208만 달러를 기록했다고 제시했다.

배포 측면에서는 곧 Alibaba Cloud Model Studio를 통해 API가 제공될 예정이며, Claude Code, OpenClaw, Qwen Code 등과의 통합 방법도 함께 안내했다. 에이전트, 코딩 어시스턴트, 사무 자동화, 로봇 내비게이션까지 포괄하는 범용 AI 에이전트 모델로 포지셔닝한 발표다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.