AI Briefing

Qwen 호환성 압도

Qwen 3.6 vs 6 other models across 5 agent frameworks on M3 Ultra

·2026.04.18 10:03

핵심 내용

M3 Ultra에서 Qwen 3.6 35B가 5개 agent framework 대부분에서 100% 도구 호출 성공률을 기록.

자세히 보기

Apple **M3 Ultra(256GB)**에서 5개 agent framework와 7개 모델을 비교한 도구 호출 호환성 벤치마크다.

  • 테스트한 framework: Hermes Agent, PydanticAI, LangChain, smolagents, OpenClaude/Anthropic SDK
  • 테스트한 모델: Qwen 3.6 35B, Qwen 3.5 35B, Qwopus 27B, Qwen 3.5 27B, Llama 3.3 70B, DeepSeek-R1 32B, Gemma 4 26B
  • 평가 항목: 단일/다중 tool 선택, 멀티턴, 스트리밍, 스트레스 테스트, 다중 tool 주입, no-leak 체크

핵심 결과는 Qwen 계열의 우세다. **Qwen 3.6 35B(4bit)**는 Hermes, PydanticAI, smolagents, OpenClaude에서 100%, LangChain에서 **93%**를 기록했고, 속도는 100 tok/s였다.

반면 비-Qwen 모델은 프레임워크별 편차가 컸다. Gemma 4 26B는 PydanticAI에서 67%, OpenClaude에서 80%, DeepSeek-R1 32B는 Hermes 55%, PydanticAI 50%, OpenClaude **40%**로 떨어졌고, Llama 3.3 70B도 Hermes 45%, LangChain **67%**에 그쳤다.

속도 표에서는 Qwen3.5-4B(168 tok/s), GPT-OSS 20B(127 tok/s), **Qwen3.5-9B(108 tok/s)**가 빠른 선택지로 제시됐고, Qwen 3.6 35B는 약 20GB RAM으로 100 tok/s를 내면서 도구 호출도 **100%**를 유지했다. 결론은 Apple Silicon에서 에이전트용 로컬 LLM은 Qwen 계열이 가장 안정적이라는 점이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.