Prover-Verifier 게임을 통한 언어 모델 출력 가독성 개선
·2024.07.17 19:00
핵심 내용
Prover-Verifier 게임을 통해 LLM이 생성한 결과물의 가독성과 검증 용이성을 동시에 향상시킬 수 있다.
자세히 보기
언어 모델이 복잡한 문제를 해결할 때, 단순히 정답률만을 높이도록 최적화하면 결과물이 이해하기 어려워지는 문제가 발생한다. 실제로 정답 최적화에만 집중한 모델의 솔루션을 인간이 평가할 경우, 그렇지 않은 모델보다 오류율이 약 2배 높게 나타났다.
이를 해결하기 위해 Prover-Verifier 게임 프레임워크를 도입했다. 이 방식은 솔루션을 생성하는 Prover(강한 모델)와 그 정확성을 확인하는 Verifier(약한 모델) 사이의 상호작용을 통해 학습을 진행한다.
학습 과정은 다음과 같은 두 단계의 반복으로 이루어진다.
- Verifier Training: 약한 모델이 Prover가 생성한 솔루션의 정답 여부를 정확히 예측하도록 학습한다.
- Prover Training: 강한 모델이 정답이면서도 Verifier가 쉽게 검증할 수 있는, 즉 가독성이 높은 솔루션을 생성하도록 유도한다.
이 방법을 통해 모델의 성능 향상 폭은 정답 최적화 방식보다 낮을 수 있지만, 인간과 다른 AI 시스템이 결과물을 훨씬 더 효과적으로 이해하고 검증할 수 있는 **가독성(Legibility)**을 확보할 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.