GRPO 학습용 1만 개 금융 추론 데이터셋 공개
[Dataset Release] I built 10k execution-verified financial problems (with 1,950 logic traps) so you don't need LLM-as-a-judge for GRPO
·2026.08.16 23:48
핵심 내용
실행 검증 가능한 Python 코드가 포함된 1만 개의 금융 추론 데이터셋 Financial-RLVR-10K가 공개되었다.
자세히 보기
Qwen, Llama, DeepSeek 등 오픈 추론 모델의 RLVR(Reinforcement Learning from Verifiable Rewards), GRPO, PPO 미세 조정을 위해 설계된 Financial-RLVR-10K 데이터셋이 공개되었다.
기존의 LLM-as-a-judge 방식은 비용이 많이 들고 보상 신호가 불분명할 수 있다는 단점이 있다. 이 데이터셋은 모든 문제에 대해 Python 솔루션 코드를 제공하며, 샌드박스 내 실행을 통해 **1.0의 결정론적 보상(Deterministic Reward)**을 부여할 수 있도록 설계되었다.
주요 특징:
- 1,950개의 논리 함정(Adversarial Logic Traps): 전체의 19.5%를 차지하며, 모델이 유효하지 않은 수학적 조건(예: Gordon Growth 모델의 r <= g 등)을 무시하고 올바른 논리를 판단하도록 훈련시킨다.
- 핵심 금융 도메인: DCF 가치 평가, Black-Scholes 옵션 가격 결정, 기업 WACC를 포함한다.
- 오픈 소스: MIT 라이선스로 배포되어 누구나 자유롭게 활용 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.