AI Briefing

퀀트가 성능 갈랐다

I tested 9 local models on the same flight sim prompt, all Q8, different Q providers, MLX

·2026.04.22 02:53

핵심 내용

같은 프롬프트로 9개 로컬 모델을 돌려, 양자화 제공자 차이와 코드 길이의 상관관계를 비교했다.

자세히 보기

M3 Max 128GB에서 8-bit MLX 기반으로 9개 local model을 같은 flight combat sim 프롬프트에 넣고 비교했다.

조건은 모두 동일했다. single-file HTML, jet/prop/wildcard 3종 선택, dynamic enemies, tracers, damage, crash spiral까지 구현하도록 시켰고, 결과는 prompts-to-final과 실제로 플레이 가능한지로 평가했다.

핵심 결과는 세 가지였다.

  • 양자화 비트수보다 provider 차이가 더 컸다. 같은 Qwen3.6 35B의 8-bit 세 변종이 서로 다른 게임 품질을 냈다.
  • Unsloth는 3프롬프트, 1,304줄로 가장 빨리 완성했고, minimap과 round planet까지 제대로 넣었다.
  • MLX Community는 4프롬프트로 무난했고, oMLX는 조종이 중립으로 되돌아가는 문제를 5번 디버깅한 끝에야 겨우 맞췄다.

코드 줄 수는 품질과 거의 상관이 없었다.

  • 승자는 Qwopus 3.5 27B로 2프롬프트, 1,049줄에 완료했다.
  • 반면 Qwen Coder Next 80B는 3프롬프트, 1,635줄로 가장 많은 코드를 뽑아냈지만, 과민한 카메라, 없는 적, 180도 회전한 비행기로 더 나쁜 결과를 냈다.

의외로 Qwopus만이 요청받지 않은 실제 비행 물리를 넣었다. 추력/항력, 기체별 공기역학 상수, 프레임 단위 속도 감쇠까지 구현했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.