AI Briefing

오픈소스 AI 정렬 도구 이관

·2026.05.07 00:00

Anthropic이 Petri 3.0을 공개하고 개발을 Meridian Labs에 이관했다.

Anthropic은 2025년 10월 공개한 오픈소스 alignment 테스트 도구 Petri를 통해 어떤 LLM이든 기만, 아첨(sycophancy), 유해 요청 협조 성향을 빠르게 점검해 왔다. Petri는 별도의 auditor model이 시나리오를 만들고, target model의 반응을 본 뒤, judge model이 결과 대화를 채점하는 구조다.

Anthropic은 Claude Sonnet 4.5 이후 모든 Claude 모델의 alignment 평가에 Petri를 포함했고, 영국 **AI Security Institute(AISI)**도 모델의 연구 방해 가능성을 평가하는 데 Petri를 핵심 도구로 활용했다.

이번 Petri 3.0의 변화는 다음과 같다.

  • Adaptability: auditor modeltarget model을 분리해 각 구성요소를 따로 조정할 수 있게 했다.
  • Realism: 추가 도구 Dish를 통해 실제 system prompt와 실제 scaffold를 사용해 테스트 현실성을 높였다.
  • Depth: 더 깊은 심층 분석이 가능한 Bloom과 연동했다.

Anthropic은 Petri의 개발을 Meridian Labs라는 비영리 AI 평가 조직에 넘겼다. 이제 Petri는 특정 AI 연구소와 분리된 독립 AI 평가 도구로 유지되며, InspectScout와 함께 연구자·정부·AI 연구소가 공통으로 쓸 수 있는 평가 스택을 형성한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.