Qwen3.6-27B SimpleQA 95.7%
We are finally there: Qwen3.6-27B + agentic search; 95.7% SimpleQA on a single 3090, fully local
·2026.05.02 20:21
핵심 내용
Qwen3.6-27B가 단일 RTX 3090 로컬 환경에서 SimpleQA 95.7%를 기록했다.
자세히 보기
RTX 3090 24GB 한 장과 Ollama(qwen3.6:27b), LangChain create_agent() 기반 langgraph_agent 전략을 결합한 완전 로컬 웹 검색형 에이전트다.
- tool-calling, parallel subtopic decomposition, 최대 50회 반복을 사용했다.
- 채점은 qwen3.6:27b self-graded 방식으로 진행했다.
- 결과는 SimpleQA 95.7% (287/300), **xbench-DeepSearch 77.0% (77/100)**였다.
- 비교표에는 Qwen3.5-9B 91.2% (182/200), **gpt-oss-20B 85.4% (295/346)**가 함께 제시됐다.
- 이는 agent + search 점수이며, closed-book 성능은 아니다.
- SimpleQA 오염 가능성, LLM-judge 노이즈, 반복 재실험 없음을 caveat로 적었고, BrowseComp / GAIA 수치는 아직 없다.
- xbench-DeepSearch가 중국어 벤치마크라 Qwen 계열에 유리할 수 있다고 덧붙였다.
- Perplexity Deep Research(93.9%)와 Tavily(93.3%)와 비슷한 수준으로 비교했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.