AI Briefing

Qwen3.6-27B SimpleQA 95.7%

We are finally there: Qwen3.6-27B + agentic search; 95.7% SimpleQA on a single 3090, fully local

·2026.05.02 20:21

핵심 내용

Qwen3.6-27B가 단일 RTX 3090 로컬 환경에서 SimpleQA 95.7%를 기록했다.

자세히 보기

RTX 3090 24GB 한 장과 Ollama(qwen3.6:27b), LangChain create_agent() 기반 langgraph_agent 전략을 결합한 완전 로컬 웹 검색형 에이전트다.

  • tool-calling, parallel subtopic decomposition, 최대 50회 반복을 사용했다.
  • 채점은 qwen3.6:27b self-graded 방식으로 진행했다.
  • 결과는 SimpleQA 95.7% (287/300), **xbench-DeepSearch 77.0% (77/100)**였다.
  • 비교표에는 Qwen3.5-9B 91.2% (182/200), **gpt-oss-20B 85.4% (295/346)**가 함께 제시됐다.
  • 이는 agent + search 점수이며, closed-book 성능은 아니다.
  • SimpleQA 오염 가능성, LLM-judge 노이즈, 반복 재실험 없음을 caveat로 적었고, BrowseComp / GAIA 수치는 아직 없다.
  • xbench-DeepSearch가 중국어 벤치마크라 Qwen 계열에 유리할 수 있다고 덧붙였다.
  • Perplexity Deep Research(93.9%)와 Tavily(93.3%)와 비슷한 수준으로 비교했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.