Qwen3 4B, 코드 태스크서 클라우드 에이전트 앞섰다
Qwen3 4B outperforms cloud agents on code tasks—with Mahoraga research [R]
·2026.04.28 06:41
핵심 내용
Mahoraga 벤치마크에서 Qwen3 4B가 클라우드 에이전트를 앞섰다.
자세히 보기
Mahoraga는 오픈소스 LinUCB 기반 contextual bandit으로 로컬·클라우드 AI 에이전트를 라우팅하는 오케스트레이터다.
16GB MacBook Pro M-series에서 192개 태스크를 돌려 4개 로컬 Ollama 모델과 4개 클라우드 CLI를 강제 라운드로빈으로 비교했다.
평가는 4층 휴리스틱으로 점수화했다.
- novelty ratio
- structural checks
- embedding similarity
- length ratio
Qwen3 4B nothink mode가 코드·리팩터링에서 가장 좋은 결과를 냈다. 처리량은 33.8 t/s, 평균 지연은 6.1초였고, 자체 코드 점수는 클라우드 에이전트들이 대체로 0.650 수준에 머물렀다.
평가에 LLM-as-judge는 쓰지 않았고, API 비용도 들지 않았다. 저자는 이 설정에서 로컬 모델이 단순히 저렴한 대안이 아니라 특정 코드 생성 작업에서는 클라우드보다 더 나을 수 있다고 해석했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.