AI Briefing

Qwen3.6·gpt-oss 벤치마크

Qwen3.6 vs gpt-oss:120b on Apple Silicon — three Qwen variants benchmarked, plus what works and where it does not

·2026.05.03 10:25

MBP M3 Max 벤치마크에서 Qwen3.6 세 변형과 gpt-oss:120b의 격차가 드러났다.

MBP M3 Max와 Ollama에서 temp 0.2, --think=false, 구조화된 research-brief 워크로드로 Qwen3.6 세 변형과 gpt-oss:120b를 비교했다.

  • qwen3.6:35b-a3b-coding-nvfp4: 6초, 21GB
  • qwen3.6:35b-a3b-q8_0 (MoE): 22초, 38GB
  • qwen3.6:27b-q8_0 (Dense): 67초, 29GB
  • gpt-oss:120b: 61초, 65GB

--think=false는 Qwen3.6 3종에선 정상 반영됐지만, gpt-oss에선 무시돼 추론 trace가 stdout에 그대로 나왔다.

FROM modelPARAMETER temperature 0.2만 바꾼 Modelfile overlay는 기존 레이어를 재사용해 디스크 추가 사용이 거의 없었다. 같은 워크로드에선 35B-A3B MoE27B dense보다 약 3배 빨랐다.

텍스트 전용 coding-NVFP4 모델은 API로 이미지를 넣어도 거부하지 않고 허위 설명을 생성할 수 있어, images:를 허용할 모델을 별도 허용 목록으로 제한해야 한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.