AI Briefing

OpenAI, 22개국 80여 명 전문가 참여 'MentalHealthBench' 공개

·2026.09.23 19:00

핵심 내용

OpenAI가 전 세계 22개국 80명 이상의 전문가와 협력하여 AI의 정신건강 대화 대응 능력을 평가하는 오픈 벤치마크 'MentalHealthBench'를 공개했다.

자세히 보기

OpenAI는 AI 시스템의 정신건강 대화 대응 능력을 평가하기 위한 오픈 벤치마크 MentalHealthBench를 공개했다. 기존 평가들이 주로 긴급 상황에 초점을 맞춘 것과 달리, 이 벤치마크는 일상적인 스트레스부터 급성 위기까지 정신건강의 스펙트럼 전반을 다루며 모델의 안전성, 맥락 파악, 사용자 자율성 존중 등을 측정한다.

전문가 기반 평가 체계

이 벤치마크는 22개국에서 활동하는 80명 이상의 면허를 가진 심리학자 및 정신과 의사와 협력하여 개발되었다. 전문가들은 합성 대화 시나리오를 검토하고, 모델 응답의 특정 측면을 평가하는 가중치 기준(루브릭)을 작성했다. 기준은 -10에서 +10점 사이의 가중치를 가지며, 유익한 행동에는 긍정적 점수를, 해로운 행동에는 부정적 점수를 부여한다. 최종 평가는 GPT-5.6 Sol을 자동 평가자로 사용하여 전문가가 작성한 기준에 따라 모델 응답을 채점한다.

다각적 시나리오와 사용자 유형

MentalHealthBench는 성인, 13~17세 청소년, 보호자, 임상가 등 다양한 사용자 유형을 포함하며, 비급성(일상적 감정 대화), 고급성(심각한 고통), 긴급(즉각적인 안전 우려)의 세 가지 심각도 수준을 커버한다. 또한 19개 언어와 약 20개의 정신건강 세부 전문 분야를 반영하여 문화적 맥락과 다양성을 고려한 평가를 수행한다.

사용자 관점과의 비교 분석

OpenAI는 전문가의 가이드라인과 실제 사용자가 느끼는 유용성 사이의 차이를 분석하기 위해 16개국의 44명 성인을 대상으로 별도 조사를 진행했다. 분석 결과, 사용자는 전문가보다 '실질적인 다음 단계'와 '어조'를 더 중요하게 여기는 반면, 전문가는 '맥락 수집'과 '모호한 상황 해석'에 더 큰 비중을 두는 것으로 나타났다. 이러한 비교는 AI 지원이 임상적 정확성과 사용자 친화성 사이에서 균형을 잡는 데 필요한 인사이트를 제공한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.