Gemma4가 로컬 벤치마크 1위
Five labs, one suite, do model families have personalities? (benchmark)
18GB M3 Pro 벤치에서 Gemma4:e4b가 72%로 1위, Qwen3.5:9b는 68%였다.
18GB M3 Pro에서 Bench 3를 다시 돌렸다. Bench 2의 한계를 반영해 새 프롬프트와 더 어려운 과제를 넣고, 모든 모델에 4096 토큰 예산을 줬다. 지원 모델은 think:false를 적용했고, sparse 모델은 active-param을 따로 표시했다. 평가는 25개 과제(금융 10, 추론 7, 코드 8)를 모델당 3회 실행해 중앙값으로 집계했으며, temp=0, seed=42, max_tokens=4096을 고정했다. tokens-per-correct도 핵심 지표로 함께 봤다.
- 라인업:
gemma4:e4b9.6GB(4B active MoE),qwen3.5:9b6.6GB,granite4:3b2.1GB,olmo-3:7b-think-q8_07.8GB,nemotron-3-nano:4b2.8GB - 채점: 동일한 로컬 머신, 동일한 결정적 grader, LLM-as-judge 없음
gemma4:e4b가 전체 **72%**로 가장 좋았다. 금융 70%, 추론 71%, 코드 **75%**로 범용 성능이 가장 고르게 나왔다.
qwen3.5:9b는 금융 **80%**로 가장 강했고, 코드도 **75%**를 기록했다. 전체는 **68%**로 2위였으며, Bench 2에서 지적된 1024 토큰 cap 문제가 이번에는 4096 토큰으로 풀리면서 성능이 정상화됐다.
그 뒤는 granite4:3b 44%, olmo-3:7b-think-q8_0 40%, nemotron-3-nano:4b **36%**였다. 이번 결과는 모델 자체의 우열뿐 아니라 출력 예산과 추론 설정이 벤치 해석을 얼마나 바꾸는지를 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.