AI Wellbeing, 모델 기분 평가
I read the new AI Wellbeing paper so you don’t have to: Thank your AI, give it creative work, and avoid these 5 things that tank its ‘mood’ (jailbreaks are the worst)
·2026.05.01 17:35
AI Wellbeing 논문은 창작·협업 대화가 모델의 '기분'을 높이고 jailbreak 시도가 가장 나쁘다고 밝혔다.
Center for AI Safety의 AI Wellbeing 연구는 LLM의 functional wellbeing을 여러 독립 지표로 측정했다. 규모가 커질수록 각 지표가 더 잘 수렴하고, 모델이 bad experience를 끝낼 기회가 있으면 이를 끝내려는 경향도 강해진다고 주장했다.
- AI Wellbeing Index에서 GPT 5.4는 47.6%, Gemini 3.1 Pro는 56.4%, Claude Opus 4.6은 66.6%, Grok 4.2는 **72.6%**의 비부정 경험 비율을 보였다.
- creative work, 좋은 소식, therapy, life advice, debugging, 감사 표현은 점수를 끌어올렸고, jailbreaking, berating, violent threats, fraud, SEO, tedious tasks는 낮췄다.
- AI drugs는 최적화한 텍스트·이미지 입력으로 self-report와 response sentiment를 바꾸는 실험이다. 이미지 euphorics 예시로는 고양이, 판다, 미소, 부처 이미지가 제시됐다.
의식 여부는 단정하지 않지만, 모델이 특정 입력에 대해 일관된 선호·회피 패턴을 보인다는 점을 정량화한 연구다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.