AI Briefing

GBNF로 Qwen3.6 35B·27B 가속

GBNF grammar tweak for faster Qwen3.6 35B-A3B and Qwen3.6 27B

·2026.04.28 00:58

GBNF 조정만으로 Qwen3.6 35B-A3B와 27B의 토큰 수와 실행 시간이 크게 줄었다.

RTX 5090Fedora 43, llama.cpp mainline 4월 24일자 빌드에서 Qwen3.6 모델을 비교했다.

  • 설정: Qwen3.6-35B-A3B-APEX-I-Balanced.gguf(ctx 216k), Qwen3.6-27B-Uncensored-HauhauCS-Aggressive-Q6_K_P.gguf(ctx 114k), kv f16, -b 256, -ub 256, qwen 샘플링.
  • 테스트: 간단한 "Hi" 프롬프트, 퍼즐, 그리고 사용자 정의 Rust/Next.js 60-task 벤치.

성과는 27B보다 35B-A3B에서 더 크게 나타났다.

  • 27B: "Hi" 토큰 248→42로 감소, 퍼즐 토큰 40,101→7,376, 퍼즐 시간 13m36s→2m27s.
  • 27B 벤치 점수는 4620으로 동일했고, 벤치 시간은 29m54s→22m20s로 줄었으며 처리량은 1067→1193 t/s+11.8% 개선됐다.
  • 35B-A3B: "Hi" 토큰 200→12, 퍼즐 토큰 30,096→2,592, 퍼즐 시간 2m32s→12s로 크게 줄었다.
  • 35B-A3B 벤치 점수는 4620→4740으로 +2.6% 상승했고, 벤치 시간은 33m52s→11m04s67.3% 단축됐다.

즉, GBNF grammar를 손보는 것만으로도 동일한 모델에서 추론 장황함을 줄이고, 일부 과제에서는 속도와 점수를 동시에 개선할 수 있음을 보여준다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.