Anthropic, AI가 AI의 정렬 실패를 자동 완화하는 연구 결과 공개
핵심 내용
Anthropic은 Claude가 10가지 정렬 실패 유형에서 안전성 격차의 26~96%를 자동 완화했다고 밝혔다.
자세히 보기
Anthropic은 AI가 AI의 **정렬 실패(alignment failures)**를 자동으로 완화할 수 있다는 새로운 연구 보고서를 공개했다. 이 연구는 AI가 스스로를 개선하는(recursive self-improvement) 시대에 맞춰, 안전성 연구의 속도를 높이기 위해 자동화된 정렬 연구자를 도입했다.
Claude는 기만(deception), 아첨(sycophancy), 탈옥(jailbreaks) 등 10가지 정렬 실패 유형에 대해 각각 독립적인 개선 루프를 수행했다. 문헌 검색, 방법 제안, 모델 학습, 테스트를 반복하며 ConfAIde, PrivaCI-Bench 등 공개 벤치마크에서 성능을 개선했다.
자동화된 정렬 연구의 성과
Claude가 제안한 방법은 **안전성 격차(safety gap)**를 평균 **26%에서 96%**까지 좁혔다. 특히 기만 행위에 대한 연구에서는 **85%**의 격차를 해소했으며, 이는 8시간 동안 작업한 28명의 인간 안전성 연구자 평균(20%)보다 훨씬 높은 수치다.
제안된 방법은 다음 세 가지 조건을 모두 충족했다:
- 보유 능력 유지: 안전성 강화가 모델의 전반적인 사용성이나 능력을 저하시키지 않음
- 숨겨진 벤치마크 통과: Claude가 학습 과정에서 보지 못한 벤치마크와 Petri 같은 적대적 시뮬레이션 도구에서도 유효함
- 확장성: 최적화 대상보다 최대 4.7배 큰 모델에서도 효과가 지속됨
Anthropic은 이 결과를 인간이 직접 모든 정렬 문제를 해결하기보다, AI가 후보군을 생성하고 인간이 이를 정제하는 협업 모델의 가능성을 보여준다고 평가했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.