GPT-4를 활용한 GPT-4의 오류 탐지
·2024.06.27 19:00
OpenAI가 ChatGPT의 코드 오류를 탐지하고 RLHF 효율을 높이기 위한 CriticGPT를 개발했다.
GPT-4와 같은 모델이 발전함에 따라 오류가 더욱 미묘해지고 있어, 인간 트레이너가 RLHF(Reinforcement Learning from Human Feedback) 과정에서 이를 식별하기가 점점 어려워지고 있다. 이는 모델의 정렬(Alignment)을 방해하는 근본적인 한계로 작용한다.
이를 해결하기 위해 ChatGPT의 코드 출력에서 오류를 잡아내는 CriticGPT를 개발했다. CriticGPT는 답변의 부정확한 부분을 지적하는 비판(Critique)을 작성하도록 훈련된 모델이다.
실험 결과, CriticGPT는 다음과 같은 성과를 입증했다:
- 인간 트레이너가 CriticGPT의 도움을 받을 경우, 도움 없이 작업할 때보다 60% 더 높은 성능을 보였다.
- ChatGPT의 자체 비판보다 불필요한 지적(nitpicks)이 적고, 환각(Hallucination) 현상도 덜 발생한다.
- 자연적으로 발생하는 오류에 대해 트레이너들이 CriticGPT의 비판을 선호하는 비율이 63%에 달했다.
CriticGPT는 테스트 시점 검색(test-time search)을 통해 정밀도와 재현율 사이의 균형을 조절하며, RLHF에 최적화된 비판을 생성할 수 있다. 다만, 현재는 짧은 코드 위주로 학습되어 복잡하고 긴 작업을 처리하는 것은 향후 과제로 남아 있다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.