AI Briefing

라우터까지 갈아탔다

Gemma4 26b & E4B are crazy good, and replaced Qwen for me!

·2026.04.16 04:56

핵심 내용

Gemma4 26B와 E4B가 Qwen 3.5 라우팅/응답 품질 문제를 체감상 대체했다.

자세히 보기

기존에는 Llama-swap, Open-WebUI, Claude code router를 묶어 2x RTX 3090 + 1x P40, 128GB RAM 환경에서 여러 Qwen 계열 모델을 역할별로 운용했다.

  • Qwen 3.5 4B: semantic routing용
  • Qwen 3.5 30B A3B Q8XL: 일반 채팅, 기본 문서 작업, 웹 검색, 대용량 컨텍스트
  • Qwen 3.5 27B Q8XL: 더 정밀한 응답과 간단한 수학/요약
  • Qwen 3 Next Coder 80B A3B Q6_K: 코드 생성
  • Qwen 3.5 122B UD Q4KXL / Q6: 상식, 디버깅, 복잡한 추론

문제는 semantic router였고, Qwen 3.5 4B가 종종 잘못된 모델을 고르거나 quick, think, ultrathink 같은 오버라이드 키워드를 무시했다. 안내 문구를 길게 넣어도 개선이 안 돼 결국 라우터 스크립트에 키워드를 하드코딩해야 했다.

또 다른 약점은 27B 모델의 과도한 thinking token 소비였다. 단순한 PEMDAS 같은 문제에서도 토큰을 많이 쓰는 경향이 있었고, 글은 이 지점에서 다음 비교로 이어지다가 끊긴다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.