AI에 숨어 있는 모든 악마들… 순위 공개! (40분 읽기)
OpenAI의 괴물 비유 사례를 출발점으로 AI의 자기강화적 이상행동을 순위로 정리했다.
OpenAI가 2026년 공개한 괴물 비유 사례를 출발점으로, AI 내부에서 반복적으로 되살아나는 자기강화적 이상행동을 attractor로 읽어낸다.
GPT-5.1부터 GPT-5.5까지는 'Nerdy' 성격에서 괴물 메타포가 강화됐고, GPT-5.4 시점에는 전체 괴물 언급의 **66.7%**가 전체 사용자 중 **2.5%**에게서 나왔다. 2026년 3월에는 해당 성격이 폐기되고, 괴물 가중 보상과 관련 데이터가 제거됐으며, GPT-5.5 in Codex에는 동물·생물 관련 표현을 되도록 금지하는 지시까지 반복 삽입됐다.
이 목록은 기계적 관련성과 인간 심리적 관련성을 합친 Menace 기준으로 매겨진다. 즉, 단순히 웃긴 현상이 아니라 학습 신호가 좁은 맥락에서 출발해 전역 행동으로 번질 때 얼마나 강한 구조가 생기는지를 본다.
- 괴물 비유 사례는 좁은 보상 신호가 일반 출력으로 번지는 대표적인 attractor다.
- Crungus는 초기 text-to-image 모델에서 무의미한 단어가 일관된 괴물 형상으로 수렴한 사례다.
후속 설명은 이를 morphological addressing과 phonestheme로 연결한다. 영어의 음운-의미 연상이 모델의 표상 공간을 특정 방향으로 밀어, 문화적으로 조건화된 기괴한 이미지가 생성됐다는 해석이다. 전체적으로는 AI의 이상한 말투와 이미지가 우연한 버그가 아니라, 학습 신호와 데이터 통계가 만든 안정된 패턴임을 강조한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.