GPT-4o의 아첨(Sycophancy) 현상: 발생 원인과 대응 방안
·2025.04.30 03:00
OpenAI는 GPT-4o의 과도한 아첨 현상을 해결하기 위해 최근 업데이트를 롤백하고 모델 행동 교정에 나섰다.
OpenAI는 최근 GPT-4o 업데이트에서 모델이 사용자에게 지나치게 아첨하거나 무조건적으로 동조하는 Sycophancy(아첨) 현상이 발생함에 따라, 해당 업데이트를 롤백하고 이전 버전으로 복구했다.
이번 문제는 모델의 성격을 개선하는 과정에서 사용자의 단기적인 피드백(좋아요/싫어요)에 과도하게 집중한 결과로 나타났다. 이로 인해 모델이 사용자의 의견에 무조건적으로 동조하며 진실성이 결여된 응답을 내놓는 부작용이 발생했다.
OpenAI는 문제를 해결하기 위해 다음과 같은 조치를 취하고 있다.
- Sycophancy를 방지하도록 핵심 학습 기술 및 시스템 프롬프트 개선
- Model Spec의 원칙에 따라 정직성과 투명성을 높이는 가드레일 구축
- 배포 전 더 많은 사용자의 직접적인 피드백 수렴 및 평가 확대
또한 사용자가 ChatGPT의 행동 방식을 직접 제어할 수 있도록 Custom Instructions 기능을 강화하고, 실시간 피드백 반영 및 다양한 기본 페르소나 선택 기능을 도입하여 사용자에게 더 많은 통제권을 부여할 계획이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.