라우터까지 갈아탔다
Gemma4 26b & E4B are crazy good, and replaced Qwen for me!
·2026.04.16 04:56
핵심 내용
Gemma4 26B와 E4B가 Qwen 3.5 라우팅/응답 품질 문제를 체감상 대체했다.
자세히 보기
기존에는 Llama-swap, Open-WebUI, Claude code router를 묶어 2x RTX 3090 + 1x P40, 128GB RAM 환경에서 여러 Qwen 계열 모델을 역할별로 운용했다.
- Qwen 3.5 4B: semantic routing용
- Qwen 3.5 30B A3B Q8XL: 일반 채팅, 기본 문서 작업, 웹 검색, 대용량 컨텍스트
- Qwen 3.5 27B Q8XL: 더 정밀한 응답과 간단한 수학/요약
- Qwen 3 Next Coder 80B A3B Q6_K: 코드 생성
- Qwen 3.5 122B UD Q4KXL / Q6: 상식, 디버깅, 복잡한 추론
문제는 semantic router였고, Qwen 3.5 4B가 종종 잘못된 모델을 고르거나 quick, think, ultrathink 같은 오버라이드 키워드를 무시했다. 안내 문구를 길게 넣어도 개선이 안 돼 결국 라우터 스크립트에 키워드를 하드코딩해야 했다.
또 다른 약점은 27B 모델의 과도한 thinking token 소비였다. 단순한 PEMDAS 같은 문제에서도 토큰을 많이 쓰는 경향이 있었고, 글은 이 지점에서 다음 비교로 이어지다가 끊긴다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.