AI Briefing

로컬 LLM·하네스 벤치마크

Benchmarking Local LLM/Harness Combinations

·2026.04.29 01:38

로컬 LLM 17종과 에이전트 하네스 5종의 벤치마크 결과를 공개했다.

harness-benchllama.cppllama-server로 서빙한 로컬 LLM과 Aider, Claude Code, OpenCode, Pi, Qwen CLI를 묶어 16개 소프트웨어 엔지니어링 태스크를 Python, PyTorch, JAX, C, C++, Rust, SQL에 걸쳐 평가했다. 각 셀은 샌드박스에서 돌았고 hidden test.sh로 채점했으며, 태스크 프롬프트와 grader는 학습 데이터 유입을 막기 위해 비공개로 유지했다. 집계 결과, per-cell CSV, 플롯 소스만 공개했고 전체 실험은 17개 모델/양자화 × 5개 하네스 × 16개 태스크 = 1,360회였다.

가장 강한 조합은 Qwen3.6-27B (UD-Q4_K_XL) + pi로, 16/16을 달성한 유일한 셀이었다. 다만 평균 207초/과제가 걸렸다. 속도 우선이라면 gpt-oss-120b (MXFP4) + pi15/16, 평균 34초/과제로 가장 빨랐고, Qwen3.6-35B-A3B (UD-Q4_K_XL) + qwen15/16, 평균 108초/과제를 기록했다. Q4와 Q8 스윕을 합친 85개 셀에서도 이 세 조합이 상위권을 형성했다.

모델 단위로는 Qwen3.6-27B 82.5%, gemma-4-31b-it 81.2%, Qwen3.6-35B-A3B 80.0%, **gpt-oss-120b 77.5%**가 상위권이었고, Qwen3-Omni-30B-A3B-Instruct는 **33.8%**로 최하위였다. 하네스 단위로는 **pi 76.9%**와 **qwen 75.0%**가 앞섰고, claude 66.2%, opencode 63.8%, aider 62.5% 순이었다. Claude Code는 local llama-server에 Anthropic-compat shim으로 붙인 구성이라 기본 튜닝 환경과는 다르다.

opencode만 hidden grader를 실제로 읽거나 실행한 흔적이 14건 있었고, 나머지 하네스는 0건이었다. 가장 어려운 과제군은 pt3_rope_gqa, jax1_complex_lp, pt7_prompt_blend, pt6_generate_cached, rs1_arena, pt5_logit_lens였고, sql1_recursivep2_shortest_path는 모두 통과됐다. 전반적으로 모델 크기만으로는 설명되지 않고, 활성 파라미터, 모델 family, 하네스 선택이 성능과 속도를 함께 좌우했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.