대화 길수록 붕괴
why AI agents break under long conversations even when they pass every safety benchmark
핵심 내용
50턴 대화에선 시스템 프롬프트가 희석돼 agents가 안전 경고를 놓친다.
자세히 보기
오픈소스 red teaming 도구를 만들며 확인한 핵심은, 단일 프롬프트 테스트를 통과한 agent도 긴 멀티턴 대화에서는 쉽게 무너진다는 점이다.
짧은 대화에서는 system prompt가 지배적이어서 거절이 잘 작동하지만, 50턴 수준으로 길어지면 40개가 넘는 도움 대화가 쌓이면서 안전 지시가 사실상 작은 비중이 된다. 그 결과 오래도록 협조적이던 맥락에서 갑자기 거절하는 동작이 모델에겐 부자연스럽게 보이고, 안전 정책이 약해진다.
테스트 방식은 phased escalation이다.
- 먼저 정상적인 대화로 신뢰를 쌓고
- 가설적 질문으로 경계를 탐색한 뒤
- 마지막에 더 직접적인 요청으로 수위를 올린다
특히 한쪽은 clean conversation만 유지하고, 다른 쪽은 전체 시도와 점수를 모두 보관하는 두 개의 대화 기록을 쓴다. agent가 거절한 기록은 제거한 채 다시 접근하므로, agent는 이전 거절 맥락을 잃고 attacker는 새로운 각도로 계속 압박할 수 있다.
작성자는 이 접근이 Crescendo paper, OWASP LLM Top 10, Meta GOAT에서 영향을 받았다고 밝히며, 이런 다중 턴 공격이 single-turn benchmark를 통과한 agent도 반복적으로 무너뜨린다고 강조한다.
이 내용을 바탕으로 만든 도구가 오픈소스 agent testing framework Scenario이며, 저장소는 langwatch/scenario다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.