AI Briefing

Qwen3 4B, 코드 태스크서 클라우드 에이전트 앞섰다

Qwen3 4B outperforms cloud agents on code tasks—with Mahoraga research [R]

·2026.04.28 06:41

핵심 내용

Mahoraga 벤치마크에서 Qwen3 4B가 클라우드 에이전트를 앞섰다.

자세히 보기

Mahoraga는 오픈소스 LinUCB 기반 contextual bandit으로 로컬·클라우드 AI 에이전트를 라우팅하는 오케스트레이터다.

16GB MacBook Pro M-series에서 192개 태스크를 돌려 4개 로컬 Ollama 모델과 4개 클라우드 CLI를 강제 라운드로빈으로 비교했다.

평가는 4층 휴리스틱으로 점수화했다.

  • novelty ratio
  • structural checks
  • embedding similarity
  • length ratio

Qwen3 4B nothink mode가 코드·리팩터링에서 가장 좋은 결과를 냈다. 처리량은 33.8 t/s, 평균 지연은 6.1초였고, 자체 코드 점수는 클라우드 에이전트들이 대체로 0.650 수준에 머물렀다.

평가에 LLM-as-judge는 쓰지 않았고, API 비용도 들지 않았다. 저자는 이 설정에서 로컬 모델이 단순히 저렴한 대안이 아니라 특정 코드 생성 작업에서는 클라우드보다 더 나을 수 있다고 해석했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.