AI에 숨어 있는 모든 악마들… 순위 공개! (40분 읽기)
·2026.05.07 09:00
핵심 내용
OpenAI의 괴물 비유 사례를 출발점으로 AI의 자기강화적 이상행동을 순위로 정리했다.
1 / 2
자세히 보기
OpenAI가 2026년 공개한 괴물 비유 사례를 출발점으로, AI 내부에서 반복적으로 되살아나는 자기강화적 이상행동을 attractor로 읽어낸다.
GPT-5.1부터 GPT-5.5까지는 'Nerdy' 성격에서 괴물 메타포가 강화됐고, GPT-5.4 시점에는 전체 괴물 언급의 **66.7%**가 전체 사용자 중 **2.5%**에게서 나왔다. 2026년 3월에는 해당 성격이 폐기되고, 괴물 가중 보상과 관련 데이터가 제거됐으며, GPT-5.5 in Codex에는 동물·생물 관련 표현을 되도록 금지하는 지시까지 반복 삽입됐다.
이 목록은 기계적 관련성과 인간 심리적 관련성을 합친 Menace 기준으로 매겨진다. 즉, 단순히 웃긴 현상이 아니라 학습 신호가 좁은 맥락에서 출발해 전역 행동으로 번질 때 얼마나 강한 구조가 생기는지를 본다.
- 괴물 비유 사례는 좁은 보상 신호가 일반 출력으로 번지는 대표적인 attractor다.
- Crungus는 초기 text-to-image 모델에서 무의미한 단어가 일관된 괴물 형상으로 수렴한 사례다.
후속 설명은 이를 morphological addressing과 phonestheme로 연결한다. 영어의 음운-의미 연상이 모델의 표상 공간을 특정 방향으로 밀어, 문화적으로 조건화된 기괴한 이미지가 생성됐다는 해석이다. 전체적으로는 AI의 이상한 말투와 이미지가 우연한 버그가 아니라, 학습 신호와 데이터 통계가 만든 안정된 패턴임을 강조한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.