AI Briefing

Anthropic, Claude의 정렬 실패 완화 연구 자동화 성공

·2026.08.28 09:00

핵심 내용

Claude가 10가지 정렬 실패 유형에서 안전성 격차의 26~96%를 해소하며 인간 연구자보다 높은 성능을 기록했다.

1 / 3

자세히 보기

Anthropic이 Claude를 활용해 AI 모델의 정렬 실패(alignment failures)를 자동으로 완화하는 연구를 수행했다. 이 연구는 AI가 스스로를 구축하는 흐름 속에서 안전성 연구가 기술 발전 속도를 따라잡기 위해 정렬 연구의 자동화가 필수적이라는 문제의식에서 출발했다.

Claude는 Petri와 같은 감사 도구를 활용해 기만, 아첨, 프라이버시 위반 등 10가지 정렬 실패 유형을 대상으로 훈련 루프를 돌았다. 문헌 검색, 방법 제안, 데이터 생성, 훈련 및 테스트를 반복하며 각 실패 유형에 대한 안전성 격차(safety gap)를 줄이는 데 집중했다.

연구 성과 및 검증

연구 결과, Claude는 모든 10가지 정렬 실패 유형에서 목표 벤치마크 성능을 개선하면서도 모델의 일반 능력을 저하시키지 않는 해결책을 찾았다. 특히 기만(deception) 실패의 경우, 반복 테스트를 통해 안전성 격차의 평균 **85%**를 해소했다. 이는 8시간 동안 작업한 인간 안전성 연구자 28명이 달성한 격차 해소율(약 20%)보다 훨씬 높은 수치다.

제안된 방법들은 Claude가 학습 과정에서 보지 못한 벤치마크에서도 효과적이었으며, Gemma-2-2B와 같은 모델에서 최대 4.7배까지 더 큰 모델 규모에서도 유효성이 유지되었다. 또한, 프론티어 규모 모델에서 60시간 내에 안전성 격차의 65%를 해소하는 성과를 보였다.

자동화 연구의 의의

이번 연구는 Claude가 인간 연구자를 대체한다기보다, 유망한 정렬 방법을 식별하여 인간이 이를 정제하는 워크플로우의 가능성을 보여준다. 인간 연구자가 즉각적으로 반복 실험을 수행하기 어려운 상황에서, AI가 대규모 반복 실험을 통해 최적의 안전성 개선 방법을 찾아내는 효율성을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.