Salesforce, 에이전트와 하네스의 공진화를 위한 더 나은 방법 발견 (9분 분량)
·2026.09.11 09:00
핵심 내용
Salesforce 연구진이 약한 모델의 모방 학습 한계를 극복하고 하네스와 모델의 공동 진화를 돕는 On-Policy Correction 파이프라인을 제안했다.
자세히 보기
Salesforce 연구진은 Agent Harness(시스템 프롬프트, 툴셋, 실행 훅 등)와 경량 미세 조정을 결합해 작은 모델의 성능을 향상시키는 연구를 진행했다. 기존 방식에서는 진화된 하네스 하에서 전문가 모델의 궤적을 약한 모델에 Imitation Learning으로 학습시킬 경우 성능이 오히려 역전되는 문제가 발생했다.
성능 역전의 원인
Qwen3-Coder와 Gemma 4 모델에서 7개 모든 엔터프라이즈 태스크에 걸쳐 4~30 포인트의 성능 하락이 관찰되었다. 이는 약한 모델이 전문가의 계획 전략을 채택하되 이를 실행할 역량이 부족해, 자신의 원래 계획 스타일에 맞춰 진화한 하네스와 매칭되지 않기 때문이다.
On-Policy Expert-Correction Pipeline
연구진은 이 문제를 해결하기 위해 Meta-level MLE agent를 활용한 자동화 파이프라인을 제안했다. 약한 모델의 자체 롤아웃에서 실패한 턴을 식별하고, 전문가 모델에게 해당 턴만 재작성하도록 요청하는 방식이다. 이 기법은 모델의 원래 계획 스타일을 보존하면서 하네스 진화와 모델 적응의 이점을 결합하여, 도메인 특화 작업에서 경제적 공동 진화를 가능하게 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.