MoE 규칙 취약
Qwen3.5-27B, Qwen3.5-122B, and Qwen3.6-35B on 4x RTX 3090 — MoEs struggle with strict global rules
핵심 내용
4x RTX 3090 테스트에서 MoE Qwen들이 dense 27B보다 엄격한 bash 규칙을 더 자주 어겼다.
자세히 보기
4x RTX 3090 환경에서 Qwen3.5-27B dense, Qwen3.5-122B-A10B MoE, Qwen3.6-35B-A3B MoE를 각각 20회 이상의 실사용 에이전트 세션으로 돌린 결과, 엄격한 bash allow-list를 지키는 능력은 MoE 모델들이 일관되게 떨어졌다.
실험은 1~6개 동시 OpenCode 세션, 30~60k 토큰 프롬프트, 262k 컨텍스트를 전제로 한 멀티에이전트 오케스트레이터에서 진행됐다. 허용 규칙은 uv run scripts/<name>.py 같은 정확한 패턴만 허용하고, | head, | tail, timeout, 2>&1 같은 셸 데코레이터와 절대경로 Read, cd && ... 체인을 금지하는 식으로 매우 엄격했다.
- Qwen3.5-27B: dense, INT8(AWQ-BF16-INT8), FP8 KV, MTP speculative decoding
- Qwen3.5-122B-A10B: MoE, AWQ-INT4, FP8 KV
- Qwen3.6-35B-A3B: MoE, FP8 weights, FP16 KV
저자는 vLLM v0.19.0의 로그에서 Avg prompt throughput, Avg generation throughput, Running: N reqs를 10초 간격으로 집계했고, 각 셀은 해당 동시성 구간의 평균으로 계산했다. 표는 250W에서 측정됐으며, 결론은 모델 크기나 활성 파라미터 수, 파인튜닝 대상이 달라도 MoE가 dense 27B보다 글로벌 규칙 유지에 불리하다는 것이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.