AI Briefing

Qwen3.6-27B SimpleQA 95.7%

We are finally there: Qwen3.6-27B + agentic search; 95.7% SimpleQA on a single 3090, fully local

·2026.05.02 20:21

Qwen3.6-27B가 단일 RTX 3090 로컬 환경에서 SimpleQA 95.7%를 기록했다.

RTX 3090 24GB 한 장과 Ollama(qwen3.6:27b), LangChain create_agent() 기반 langgraph_agent 전략을 결합한 완전 로컬 웹 검색형 에이전트다.

  • tool-calling, parallel subtopic decomposition, 최대 50회 반복을 사용했다.
  • 채점은 qwen3.6:27b self-graded 방식으로 진행했다.
  • 결과는 SimpleQA 95.7% (287/300), **xbench-DeepSearch 77.0% (77/100)**였다.
  • 비교표에는 Qwen3.5-9B 91.2% (182/200), **gpt-oss-20B 85.4% (295/346)**가 함께 제시됐다.
  • 이는 agent + search 점수이며, closed-book 성능은 아니다.
  • SimpleQA 오염 가능성, LLM-judge 노이즈, 반복 재실험 없음을 caveat로 적었고, BrowseComp / GAIA 수치는 아직 없다.
  • xbench-DeepSearch가 중국어 벤치마크라 Qwen 계열에 유리할 수 있다고 덧붙였다.
  • Perplexity Deep Research(93.9%)와 Tavily(93.3%)와 비슷한 수준으로 비교했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.