GLM 5.2, 실제 사용자 데이터 기반 RFT와 Hint-guided Self-distillation으로 Tool-call 실패율 21.2% 감소
핵심 내용
GLM 5.2가 실제 사용자 세션 데이터를 활용한 RFT와 Hint-guided Self-distillation 결합 학습으로 Tool-call 실패율을 21.2% 낮췄다.
자세히 보기
GLM 5.2는 합성 환경과 실제 사용 간 격차를 해소하기 위해 **Rejection Sampling Fine-tuning(RFT)**과 Hint-guided Self-distillation을 결합한 새로운 학습 방법론을 적용했다. 기존 RFT가 성공 세션만 학습해 중간 단계의 오류를 강화하고 실패 세션의 학습 신호를 폐기하던 한계를 극복하기 위해, 실제 사용자 세션의 성공과 실패 데이터를 모두 활용하는 새로운 파이프라인을 도입했다.
학습 방법론: Hint-guided Self-distillation
제안된 방법은 성공 세션의 비오류 턴은 **Imitation(CE Loss)**으로, 오류가 발생한 턴 중 유효한 Hint가 있는 경우는 **Correction(KL Loss)**으로 처리한다. Hint는 모델이 실수 당시 이미 가지고 있던 정보에 기반한 짧은 교정 지시문으로 정의되며, 이를 통해 **On-Policy Self-Distillation(OPSD)**을 수행한다. Teacher 모델은 Hint를 입력받아 Target 분포를 생성하고, Student 모델은 Hint 없이 입력받아 Teacher의 분포를 모방하도록 학습된다.
평가 결과 및 성능 개선
오프라인 벤치마크와 라이브 사용자 세션(A/B 테스트)을 통해 성능을 검증했다.
- Hint 효과 검증: Hint를 제공했을 때 명시적 증거 기반 교정률이 40.0%에서 75.0%로, Tool-error 회피율이 75.1%에서 93.7%로 크게 향상되었다.
- 오프라인 Tool Error Rate: Stock GLM 5.2(2.79%) 대비 RFT-only(1.35%) 및 RFT-plus-OPSD(0.87%) 체크포인트에서 오류율이 감소했다.
- 라이브 사용(A/B Test): RFT-plus-OPSD 적용 후속 체크포인트(Checkpoint 2)는 이전 체크포인트(Checkpoint 1) 대비 Tool-call 실패율을 21.2% 감소시켰다. 다만, 사용자 불만(MID+ rate) 감소는 통계적으로 유의하지 않았다.
한계 및 시사점
이 방법은 세션 전체가 아닌 '결정(decision)' 수준에서 학습하여, 성공 세션은 보존할 행동의 앵커로, 불만과 Tool error는 피할 수 있는 실패 식별용으로 활용한다. 현재 가장 강력한 증거는 Tool Reliability 개선에 국한되며, 단일 Turn 교정이 전체 Task 성공을 보장하지는 않는다는 한계가 있다. 궁극적인 목표는 교정 후 복구하는 Agent가 아니라, 교정이 덜 필요한 Agent를 만드는 것이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.