WeiboAI, CLR 추론 프레임워크 공개
[Paper] GitHub - WeiboAI/CLR: Claim-Level Reliability Assessment for Efficient Test-Time Reasoning
·2026.08.17 21:19
핵심 내용
테스트 시간 추론 효율을 높이기 위해 클레임 단위로 오류를 검증하는 CLR 프레임워크를 제안함.
자세히 보기
**CLR(Claim-Level Reliability Assessment)**은 테스트 시간 스케일링(test-time scaling)을 위해 클레임 수준의 허위 판별(claim-level falsification) 원칙을 사용하는 훈련 불필요(training-free) 프레임워크임.
기존의 전체 추론 경로(whole-trace) 평가 방식은 불필요한 토큰들로 인해 결정적인 오류가 희석되는 문제가 있음. CLR은 각 추론 경로를 핵심적인 결정적 클레임(decision-critical claims) 세트로 압축하여 논리적 앵커를 격리함.
또한, CLR은 솔루션 구축보다 **클레임 반박(claim refutation)**이 더 쉽다는 비대칭성을 활용함. 단 하나의 결정적 결함만 찾아내면 오류를 입증할 수 있다는 점을 이용해, 비선형 신뢰도 점수(nonlinear reliability scoring)로 잘못된 합의를 억제함.
주요 성과:
- 4개의 LLM 및 4개의 추론 벤치마크에서 pass@1 및 self-consistency 성능 향상.
- GPT-OSS-20B/CMIMC25 기준, pass@1을 27.15%p 개선하고, self-consistency 정확도를 **77.50%에서 82.19%**로 높이면서도 토큰 사용량은 37.0% 절감.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.