AI Briefing

신뢰성 높은 데이터 분석 에이전트

·2026.04.30 09:00

핵심 내용

DataPRM이 데이터 분석 에이전트의 숨은 오류를 잡아 성능을 높였다.

자세히 보기

Process Reward Models(PRMs) 는 수학처럼 정적 영역에서는 잘 작동했지만, 데이터 분석 에이전트처럼 환경이 계속 바뀌는 작업에는 약했다. 인터프리터 예외 없이 잘못된 결과를 만드는 silent errors를 놓치고, 필요한 탐색적 행동까지 grounding 실패로 오판하는 문제가 드러났다.

이를 해결하는 DataPRM은 환경과 직접 상호작용하는 active verifier로 동작한다. 중간 실행 상태를 능동적으로 점검해 숨은 오류를 찾고, 시행착오가 필요한 구간도 제대로 평가하도록 설계됐다.

  • reflection-aware ternary reward로 수정 가능한 grounding 오류와 복구 불가능한 실수를 구분했다.
  • 다양성 기반 trajectory 생성과 지식 증강을 결합한 step-level annotation으로 8K+ 학습 인스턴스를 구축했다.

성과도 분명했다. Best-of-N 추론에서 ScienceAgentBench 7.21%, DABStep 11.28% 성능을 끌어올렸고, 4B 모델 크기만으로도 강한 베이스라인을 앞섰다.

또한 다양한 test-time scaling 전략에서도 일반화가 유지됐으며, RL에 적용했을 때는 outcome-reward 기반보다 더 좋은 결과를 냈다. 최종적으로 DABench 78.73%, **TableBench 64.84%**를 기록했고, 코드는 DataMind 저장소에 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.