AI Briefing

외부 테스트를 통한 안전 생태계 강화

·2025.11.19 21:00

OpenAI는 프론티어 AI의 안전성을 검증하기 위해 외부 전문 기관과의 협력을 통한 독립적 평가 체계를 강화한다.

OpenAI는 프론티어 AI의 안전 생태계를 강화하기 위해 독립적이고 신뢰할 수 있는 **제3자 평가(Third-party assessments)**를 적극 활용한다. 이는 모델의 안전 역량과 완화 조치에 대한 주장을 검증하고, 잠재적 사각지대를 방지하며, 투명성을 높이는 데 목적이 있다.

외부 협력은 크게 세 가지 형태로 이루어진다.

  • 독립적 평가(Independent evaluations): 생물 보안, 사이버 보안, AI 자가 개선, 스키밍(scheming) 등 핵심 위험 영역 테스트
  • 방법론 검토(Methodology reviews): 위험 평가 및 해석 방식 검증
  • 전문가 프로빙(SME probing): 분야별 전문가가 실제 과업을 통해 모델을 직접 평가하고 안전 조치에 대한 피드백 제공

이러한 평가는 내부 테스트의 한계를 보완하고 **자기 확증 편향(Self-confirmation)**을 방지하는 독립적인 계층 역할을 한다. GPT-5의 경우, 장기 자율성, 기만, 감독 우회, 생물 실험 계획 가능성 등 광범위한 외부 역량 평가를 조율하여 배포 결정을 지원한다.

평가 과정에서는 METR의 시간 지평 평가나 SecureBio의 바이러스학 역량 테스트(VCT)와 같은 벤치마크가 활용된다. OpenAI는 외부 기관에 초기 모델 체크포인트에 대한 보안 액세스, 데이터 미보관(Zero-data retention) 환경, 안전 완화 조치가 적용되지 않은 모델 등을 제공하여 모델의 근본적인 역량을 정밀하게 측정할 수 있도록 지원한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.