AI Briefing

공동체 안전에 대한 우리의 약속

·2026.04.28 09:00

핵심 내용

OpenAI가 ChatGPT의 폭력·자해 위험 대응과 제재 체계를 강화한다고 밝혔다.

자세히 보기

OpenAI는 ChatGPT가 폭력·자해로 이어질 수 있는 요청은 거부하되, 뉴스·역사·교육·예방 목적의 중립적 질문은 허용하는 균형을 유지한다고 밝혔다.

  • Model Spec를 기준으로 실행 가능한 폭력 지침, 전술, 계획은 차단한다.
  • 장기 대화와 대화 간 패턴까지 분석해 미묘한 위험 신호를 더 잘 포착하도록 감지 체계를 강화했다.
  • 심리학자·정신과 의사·시민자유·법집행 전문가의 자문을 받아 안전·프라이버시·접근성의 균형을 계속 다듬는다.

위기 상황에서는 지역별 위기 자원과 정신건강 전문가, 신뢰할 수 있는 지인 연결을 안내하고, 심각한 경우 응급 도움을 권고한다.

운영 측면에서는 자동 감지 시스템이 분류기, 추론 모델, 해시 매칭, 차단 목록 등을 활용해 의심 사례를 걸러낸다. 이후 인간 검토가 제한된 접근 권한과 보안·비밀 유지 규칙 아래 맥락을 확인한다.

위반이 확인되면 자사 Usage Policies의 무관용 원칙에 따라 계정 비활성화, 연관 계정 차단, 신규 계정 개설 차단까지 적용한다. 사용자는 제재에 이의를 제기할 수 있고, 회사는 이를 다시 검토한다. 임박하고 신뢰할 수 있는 폭력 위험이 확인되면 법집행기관에 알린다.

지난 가을 도입한 Parental Controls는 부모가 청소년 계정을 연결해 안전 설정을 조정하게 하며, 대화 내용은 직접 볼 수 없다. 시스템과 인간 검토가 급성 위기 신호를 감지하면 이메일·SMS·푸시 알림으로 통지하고, 성인 사용자가 지정한 trusted contact 기능도 곧 도입할 계획이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.