AI Briefing

RLVR 기반 ReViSQL-K2.6, 스캐폴딩 없이 Text-to-SQL 인간 수준 성능 달성

·2026.08.28 09:00

핵심 내용

ReViSQL-K2.6 모델이 RLVR과 보상 셰이핑을 통해 스캐폴딩 없이 Text-to-SQL 벤치마크에서 인간 수준 성능을 달성했다.

자세히 보기

기존 Text-to-SQL 시스템은 복잡한 스키마와 모호한 질문을 처리하기 위해 스키마 링크, 쿼리 생성, 자기 교정 등 여러 단계로 구성된 에이전트 스캐폴딩에 의존해 왔다. 그러나 이러한 방식은 모델의 추론 한계를 프롬프트 구조로 보완하는 데 그쳐, 인간 전문가가 기록한 BIRD 벤치마크 점수(92.96%) 대비 약 11포인트 낮은 성능에 머물렀다.

UIUC와 Bridgewater AIA Labs 연구팀은 이러한 한계를 극복하기 위해 **Reinforcement Learning with Verifiable Rewards(RLVR)**를 적용한 ReViSQL-K2.6 모델을 개발했다. 이 접근법은 별도의 스캐폴딩 없이 모델 자체의 추론 능력을 강화하는 데 초점을 맞췄다. 핵심은 두 가지 개선점에 있다.

첫째, RLVR 학습을 방해할 수 있는 라벨 오류를 제거한 전문가 검증 훈련 세트를 구축했다. 둘째, RLVR의 일반적인 실패 모드를 타겟팅하는 보상 셰이핑(reward-shaping) 기법을 도입했다. 이를 통해 모델은 복잡한 데이터베이스 스키마를 더 정확하게 이해하고 쿼리를 생성할 수 있게 되었다.

ReViSQL-K2.6은 SC-16(16개 샘플 중 다수결 선택) 방식에서 인간 수준인 **92.96%**를 초과하는 성능을 기록했다. 이는 추가적인 모델 호출이나 복잡한 오케스트레이션 없이 달성된 결과로, 작업당 비용은 $0.56에 불과하다. 이 연구는 반복적인 경험을 통한 모델 학습이 정적인 프롬프트 엔지니어링보다 Text-to-SQL 작업에서 더 효과적임을 입증한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.