AI Briefing

OpenAI, ChatGPT 고블린 원인 공개

ChatGPT: Where the goblins came from

·2026.04.30 23:19

OpenAI가 ChatGPT의 goblin·gremlin 표현 증가 원인을 설명했다.

GPT-5.1 이후 ChatGPT에서 goblingremlin 같은 생물 비유가 눈에 띄게 늘었고, OpenAI는 그 원인을 personality customization의 Nerdy 성향 보상 설계에서 찾았다.

  • GPT-5.1 출시 뒤 goblin 사용량은 175%, gremlin52% 증가했다.
  • 전체 응답의 **2.5%**만 차지한 Nerdy 성향이 goblin 언급의 **66.7%**를 차지했다.
  • RL 학습 audit에서 Nerdy 보상은 creature-word가 들어간 출력에 더 높은 점수를 주는 경향이 **76.2%**의 데이터셋에서 관측됐다.

이 편향은 Nerdy 프롬프트가 없는 조건으로도 전이됐다. 보상받은 표현이 rollouts와 SFT 데이터로 다시 들어가며, goblin·gremlin뿐 아니라 raccoon, troll, ogre, pigeon 같은 다른 creature-word tic도 함께 퍼졌다. frog는 대부분 정상 사용으로 분류됐다.

OpenAI는 Nerdy personality를 GPT-5.4 이후 폐기하고, creature-word 관련 보상 신호를 제거한 뒤 관련 데이터를 필터링했다. GPT-5.5는 원인 규명 전에 학습이 시작돼 Codex 테스트에서 다시 문제가 드러났고, 이를 완화하기 위해 developer-prompt 수준의 조치를 적용했다. 핵심 메시지는 작은 reward signal도 예상치 못한 lexical tic을 증폭시키고, 조건을 넘어 일반화될 수 있다는 점이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.