Qwen-Sharp-Chat-Templates: Qwen 모델에 토큰으로 사고 깊이 조절
peculiar-ragdoll/Qwen-Sharp-Chat-Templates
프로젝트 소개
Qwen 계열 LLM에 적용하는 Jinja2 기반 채팅 템플릿이다. 사용자 메시지 안에 특정 태그를 넣으면 모델의 추론 깊이와 툴 호출 방식을 제어할 수 있다.
메시지에 <|think_xhigh|>, <|think_low|>, <|think_medium|> 같은 태그를 포함하면 템플릿이 이를 감지해 시스템 프롬프트에 해당하는 지시문을 주입한다. xhigh는 정밀 검증과 대안 검토를, low는 간결한 결론 도출을 요구한다. <|think_on|>과 <|think_off|>로 추론 모드 자체를 켜고 끌 수도 있다.
기본값으로 terse 모드가 활성화되어 불필요한 서론과 반복을 제거하고 핵심 답변만 출력하도록 유도한다. 이 동작은 chat_template_kwargs의 terse 플래그를 false로 설정해 비활성화할 수 있다. 도구 호출 시에는 JSON 또는 XML 포맷 중 하나를 선택해 출력 형식을 고정한다.
Qwen 모델을 직접 서빙하면서 추론 품질과 응답 속도를 상황에 맞게 조절하려는 개발자에게 적합하다. 별도 파인튜닝 없이 프롬프트 레벨에서 모델의 사고 깊이를 제어할 수 있어 A/B 테스트나 프로덕션 환경의 응답 톤 조정 용도로 쓰인다.
peculiar-ragdoll/Qwen-Sharp-Chat-Templates
원문에 등록된 설명이 없습니다.
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.


