Qwen3.6 모델 성능 저하 버그
Qwen3.6-35B-A3B: llama.cpp bug dropping some cache which can add 1-3seconds per turn affects
·2026.05.24 13:18
llama.cpp의 버그로 인해 Qwen3.6-35B-A3B 모델의 KV 캐시가 누락되어 추론 속도가 크게 저하되는 문제가 발생했습니다.
llama.cpp에서 Qwen3.6-35B-A3B 모델 사용 시, KV 캐시의 마지막 부분이 배치 사이즈(batch size)만큼 누락되는 버그가 보고되었습니다. 이로 인해 매 턴마다 누락된 토큰을 다시 처리해야 하므로 컨텍스트가 길어질수록 성능 저하가 심각해집니다.
주요 현상:
- 150k 컨텍스트 및 배치 사이즈 4096 설정 시, 프리필(prefill) 시간이 317ms에서 3,074ms로 약 10배 증가합니다.
- 해당 문제는
Qwen3.6-35B-A3B모델에서만 확인되었으며, Gemma 등 다른 모델에서는 재현되지 않았습니다.
해결 방법(Workaround):
- 빌드 b9222 버전을 사용하거나,
- 커밋 ccee426으로 롤백한 후 소스에서 직접 빌드하여 사용해야 합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.