llama.cpp, reasoning_effort 버그 확인
llama.cpp: reasoning_effort not forwarded to chat template (Qwen3.8-27B)
·2026.08.15 06:47
핵심 내용
llama.cpp의 llama-server가 reasoning_effort 파라미터를 chat template으로 전달하지 못하는 버그가 보고되었습니다.
자세히 보기
llama-server가 reasoning_effort 파라미터를 처리할 때, "none" 값은 인식하여 사고(thinking) 기능을 비활성화하지만, low, medium, high 등 다른 설정값은 무시하고 chat template에 전달하지 않는 문제가 발견되었습니다.
이로 인해 Qwen3.8-27B와 같이 reasoning_effort 값에 따라 추론 지시문을 다르게 주입하는 Jinja 템플릿을 사용하는 모델의 경우, 사용자가 설정한 값과 관계없이 항상 기본값(예: xhigh)으로 동작하게 됩니다.
주요 영향:
- 표준 API 제어 불가: OpenAI SDK나 VSCode Copilot처럼 표준
reasoning_effort필드를 사용하는 클라이언트는 모델의 추론 강도를 제어할 수 없습니다. - 우회 방법의 한계:
chat_template_kwargs를 직접 조작하는 클라이언트만 임시로 대응이 가능합니다.
해결 방안:
"none"이 아닌 값이 입력될 경우, 해당 값을 chat_template_kwargs에 포함하여 전달하도록 하는 코드 수정이 제안되었습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.