Qwen3.6·gpt-oss 벤치마크
Qwen3.6 vs gpt-oss:120b on Apple Silicon — three Qwen variants benchmarked, plus what works and where it does not
·2026.05.03 10:25
핵심 내용
MBP M3 Max 벤치마크에서 Qwen3.6 세 변형과 gpt-oss:120b의 격차가 드러났다.
자세히 보기
MBP M3 Max와 Ollama에서 temp 0.2, --think=false, 구조화된 research-brief 워크로드로 Qwen3.6 세 변형과 gpt-oss:120b를 비교했다.
qwen3.6:35b-a3b-coding-nvfp4: 6초, 21GBqwen3.6:35b-a3b-q8_0 (MoE): 22초, 38GBqwen3.6:27b-q8_0 (Dense): 67초, 29GBgpt-oss:120b: 61초, 65GB
--think=false는 Qwen3.6 3종에선 정상 반영됐지만, gpt-oss에선 무시돼 추론 trace가 stdout에 그대로 나왔다.
FROM model과 PARAMETER temperature 0.2만 바꾼 Modelfile overlay는 기존 레이어를 재사용해 디스크 추가 사용이 거의 없었다. 같은 워크로드에선 35B-A3B MoE가 27B dense보다 약 3배 빨랐다.
텍스트 전용 coding-NVFP4 모델은 API로 이미지를 넣어도 거부하지 않고 허위 설명을 생성할 수 있어, images:를 허용할 모델을 별도 허용 목록으로 제한해야 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.