AI Briefing

깨끗한 trace가 승부를 갈랐다

What we learned trying to fine-tune a small tool-calling model from production traces (and what not to do)

·2026.04.17 02:09

핵심 내용

정제된 데이터에선 1.7B가 744B를 이겼지만, 노이즈 trace는 성능을 무너뜨렸다.

자세히 보기

작고 빠른 multi-turn tool-calling 모델을 만들기 위해, 생산 환경의 trace를 그대로 학습시키는 접근을 시험했다.

실험은 Google Research의 Schema Guided Dialogue (SGD) 데이터셋, 그중 레스토랑 예약 도메인에서 진행됐다. 도구는 FindRestaurants, ReserveRestaurant, respond_to_user의 3개였고, 학생 모델은 Qwen3-1.7B + LoRA rank 64였다.

정제된 인간 주석 데이터로 학습했을 때는 결과가 매우 좋았다.

  • 학생 모델 Qwen3-1.7B: 0.866 LLM-as-a-judge 점수
  • 비교 대상 GLM-5 (744B): 0.835
  • Qwen3-235B: 0.768
  • GPT-OSS-120B: 0.765
  • DeepSeek-3.2: 0.744

즉, 1.7B 모델이 744B 교사보다 3점 높게 나왔고, 데이터가 좋으면 작은 모델도 task-specific tool-calling에서 강력하게 학습된다는 점이 확인됐다.

문제는 실제 production-style noise를 섞었을 때였다. 저자들은 현실적인 trace를 넣는 순간 직접 학습 성능이 14~28%p 하락했다고 보고하며, 어떤 실패 모드가 모델을 망가뜨리는지와 무엇이 실제로 이를 고쳤는지를 정리한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.