RLVR 기반 ReViSQL-K2.6, 스캐폴딩 없이 Text-to-SQL 인간 수준 성능 달성
핵심 내용
ReViSQL-K2.6 모델이 RLVR과 보상 셰이핑을 통해 스캐폴딩 없이 Text-to-SQL 벤치마크에서 인간 수준 성능을 달성했다.
자세히 보기
기존 Text-to-SQL 시스템은 복잡한 스키마와 모호한 질문을 처리하기 위해 스키마 링크, 쿼리 생성, 자기 교정 등 여러 단계로 구성된 에이전트 스캐폴딩에 의존해 왔다. 그러나 이러한 방식은 모델의 추론 한계를 프롬프트 구조로 보완하는 데 그쳐, 인간 전문가가 기록한 BIRD 벤치마크 점수(92.96%) 대비 약 11포인트 낮은 성능에 머물렀다.
UIUC와 Bridgewater AIA Labs 연구팀은 이러한 한계를 극복하기 위해 **Reinforcement Learning with Verifiable Rewards(RLVR)**를 적용한 ReViSQL-K2.6 모델을 개발했다. 이 접근법은 별도의 스캐폴딩 없이 모델 자체의 추론 능력을 강화하는 데 초점을 맞췄다. 핵심은 두 가지 개선점에 있다.
첫째, RLVR 학습을 방해할 수 있는 라벨 오류를 제거한 전문가 검증 훈련 세트를 구축했다. 둘째, RLVR의 일반적인 실패 모드를 타겟팅하는 보상 셰이핑(reward-shaping) 기법을 도입했다. 이를 통해 모델은 복잡한 데이터베이스 스키마를 더 정확하게 이해하고 쿼리를 생성할 수 있게 되었다.
ReViSQL-K2.6은 SC-16(16개 샘플 중 다수결 선택) 방식에서 인간 수준인 **92.96%**를 초과하는 성능을 기록했다. 이는 추가적인 모델 호출이나 복잡한 오케스트레이션 없이 달성된 결과로, 작업당 비용은 $0.56에 불과하다. 이 연구는 반복적인 경험을 통한 모델 학습이 정적인 프롬프트 엔지니어링보다 Text-to-SQL 작업에서 더 효과적임을 입증한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.