AI Briefing

Qwen3.6·gpt-oss 벤치마크

Qwen3.6 vs gpt-oss:120b on Apple Silicon — three Qwen variants benchmarked, plus what works and where it does not

·2026.05.03 10:25

핵심 내용

MBP M3 Max 벤치마크에서 Qwen3.6 세 변형과 gpt-oss:120b의 격차가 드러났다.

자세히 보기

MBP M3 Max와 Ollama에서 temp 0.2, --think=false, 구조화된 research-brief 워크로드로 Qwen3.6 세 변형과 gpt-oss:120b를 비교했다.

  • qwen3.6:35b-a3b-coding-nvfp4: 6초, 21GB
  • qwen3.6:35b-a3b-q8_0 (MoE): 22초, 38GB
  • qwen3.6:27b-q8_0 (Dense): 67초, 29GB
  • gpt-oss:120b: 61초, 65GB

--think=false는 Qwen3.6 3종에선 정상 반영됐지만, gpt-oss에선 무시돼 추론 trace가 stdout에 그대로 나왔다.

FROM model과 PARAMETER temperature 0.2만 바꾼 Modelfile overlay는 기존 레이어를 재사용해 디스크 추가 사용이 거의 없었다. 같은 워크로드에선 35B-A3B MoE가 27B dense보다 약 3배 빨랐다.

텍스트 전용 coding-NVFP4 모델은 API로 이미지를 넣어도 거부하지 않고 허위 설명을 생성할 수 있어, images:를 허용할 모델을 별도 허용 목록으로 제한해야 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.