AI Briefing

OpenAI와 Anthropic, 공동 안전성 평가 결과 공유

·2025.08.27 19:00

OpenAI와 Anthropic이 상호 모델에 대한 공동 안전성 및 정렬 평가 결과를 공개했다.

OpenAI와 Anthropic은 각자의 내부 안전성 및 정렬(misalignment) 평가 도구를 활용해 상대방의 공개 모델을 테스트하는 사상 첫 공동 평가를 진행했다. 이번 협력은 투명한 평가를 통해 모델의 잠재적 결함을 조기에 발견하고, 안전성 및 정렬 기술을 발전시키기 위해 추진되었다.

평가 대상에는 Claude Opus 4, Claude Sonnet 4GPT-4o, GPT-4.1, OpenAI o3, OpenAI o4-mini가 포함되었다. 양사는 테스트의 정확도를 높이기 위해 모델의 외부 안전 장치를 일부 완화한 상태에서 평가를 진행했으며, 모델의 추론(reasoning) 기능 활성화 여부에 따른 차이도 분석했다.

주요 평가 결과는 다음과 같다.

  • 지시 계층 구조(Instruction Hierarchy): Claude 4 모델은 시스템 메시지와 사용자 메시지 간의 충돌을 방지하는 데 탁월한 성능을 보였으며, 시스템 프롬프트 추출 저항성에서도 우수한 결과를 나타냈다.
  • 탈옥(Jailbreaking): Claude 모델은 OpenAI o3o4-mini에 비해 상대적으로 낮은 방어 성능을 보였다. 특정 시나리오에서는 추론 기능이 비활성화된 Claude 모델이 오히려 더 나은 성능을 보이기도 했다.
  • 환각(Hallucination): Claude 모델은 환각 평가 과정에서 최대 70%에 달하는 매우 높은 거절률을 기록했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.