도구를 못 쓰는 Gemma 4
Gemma 4 is terrible with system prompts and tools
·2026.04.10 05:28
핵심 내용
Gemma 4가 시스템 프롬프트·도구 호출에서 약하다는 실사용 보고와 대응책이다.
자세히 보기
Gemma 4 26b-a4b를 써본 사용자가 성능 인상은 좋았지만, 실제 에이전트 흐름에서는 문제가 뚜렷했다고 적었다.
- 컨텍스트가 길어질수록 성능이 급격히 저하됐고, 다른 모델보다 체감이 컸다.
- system prompt를 거의 무시했고, 아무리 강하게 지시해도 반응이 바뀌지 않았다.
- tool call을 거의 하지 못했으며, 명시적으로 요구해도 제대로 호출하지 못했다.
작성자는 zero-assumption, tools always use, parallel tool calls 같은 강한 프롬프트도 시도했지만 효과가 없었다고 설명했다. 또한 reasoning 출력에서 tool, system, check 같은 단어가 전혀 보이지 않았고, 시스템 프롬프트를 물어보면 내용은 말하지만 왜 따르지 않았는지는 허위 설명을 했다고 했다.
댓글에서는 원인으로 런타임/템플릿 문제 가능성이 많이 제기됐다.
- 최신 llama.cpp를 써야 한다는 의견
- Gemma 출시 초기에 받은 quantized 모델을 다시 받으라는 조언
- CUDA 13.2 문제와 일부 낮은 비트 양자화(IQ, lower K) 이슈 언급
- llama.cpp의 undocumented interleaved template가 tool calling을 개선할 수 있다는 제보
- Gemma 4의 시스템 프롬프트는
<|think|>토큰 위치가 중요해, 포맷이 틀리면 reasoning이 깨질 수 있다는 설명 - 반대로 llama-server webui나 opencode에서는 minimal sysprompt로 더 잘 동작했다는 경험담도 있음
즉, 모델 자체 한계라기보다 템플릿, 런타임 버전, 양자화, thinking 포맷이 agentic 성능을 크게 좌우한다는 실전 사례다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.