AI Briefing

GPT-4를 활용한 GPT-4의 오류 탐지

·2024.06.27 19:00

핵심 내용

OpenAI가 ChatGPT의 코드 오류를 탐지하고 RLHF 효율을 높이기 위한 CriticGPT를 개발했다.

자세히 보기

GPT-4와 같은 모델이 발전함에 따라 오류가 더욱 미묘해지고 있어, 인간 트레이너가 RLHF(Reinforcement Learning from Human Feedback) 과정에서 이를 식별하기가 점점 어려워지고 있다. 이는 모델의 정렬(Alignment)을 방해하는 근본적인 한계로 작용한다.

이를 해결하기 위해 ChatGPT의 코드 출력에서 오류를 잡아내는 CriticGPT를 개발했다. CriticGPT는 답변의 부정확한 부분을 지적하는 비판(Critique)을 작성하도록 훈련된 모델이다.

실험 결과, CriticGPT는 다음과 같은 성과를 입증했다:

  • 인간 트레이너가 CriticGPT의 도움을 받을 경우, 도움 없이 작업할 때보다 60% 더 높은 성능을 보였다.
  • ChatGPT의 자체 비판보다 불필요한 지적(nitpicks)이 적고, 환각(Hallucination) 현상도 덜 발생한다.
  • 자연적으로 발생하는 오류에 대해 트레이너들이 CriticGPT의 비판을 선호하는 비율이 63%에 달했다.

CriticGPT는 테스트 시점 검색(test-time search)을 통해 정밀도와 재현율 사이의 균형을 조절하며, RLHF에 최적화된 비판을 생성할 수 있다. 다만, 현재는 짧은 코드 위주로 학습되어 복잡하고 긴 작업을 처리하는 것은 향후 과제로 남아 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.