깨끗한 trace가 승부를 갈랐다
What we learned trying to fine-tune a small tool-calling model from production traces (and what not to do)
·2026.04.17 02:09
핵심 내용
정제된 데이터에선 1.7B가 744B를 이겼지만, 노이즈 trace는 성능을 무너뜨렸다.
자세히 보기
작고 빠른 multi-turn tool-calling 모델을 만들기 위해, 생산 환경의 trace를 그대로 학습시키는 접근을 시험했다.
실험은 Google Research의 Schema Guided Dialogue (SGD) 데이터셋, 그중 레스토랑 예약 도메인에서 진행됐다. 도구는 FindRestaurants, ReserveRestaurant, respond_to_user의 3개였고, 학생 모델은 Qwen3-1.7B + LoRA rank 64였다.
정제된 인간 주석 데이터로 학습했을 때는 결과가 매우 좋았다.
- 학생 모델 Qwen3-1.7B: 0.866 LLM-as-a-judge 점수
- 비교 대상 GLM-5 (744B): 0.835
- Qwen3-235B: 0.768
- GPT-OSS-120B: 0.765
- DeepSeek-3.2: 0.744
즉, 1.7B 모델이 744B 교사보다 3점 높게 나왔고, 데이터가 좋으면 작은 모델도 task-specific tool-calling에서 강력하게 학습된다는 점이 확인됐다.
문제는 실제 production-style noise를 섞었을 때였다. 저자들은 현실적인 trace를 넣는 순간 직접 학습 성능이 14~28%p 하락했다고 보고하며, 어떤 실패 모드가 모델을 망가뜨리는지와 무엇이 실제로 이를 고쳤는지를 정리한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.