AI Briefing

대화 길수록 붕괴

why AI agents break under long conversations even when they pass every safety benchmark

·2026.04.15 21:09

핵심 내용

50턴 대화에선 시스템 프롬프트가 희석돼 agents가 안전 경고를 놓친다.

자세히 보기

오픈소스 red teaming 도구를 만들며 확인한 핵심은, 단일 프롬프트 테스트를 통과한 agent도 긴 멀티턴 대화에서는 쉽게 무너진다는 점이다.

짧은 대화에서는 system prompt가 지배적이어서 거절이 잘 작동하지만, 50턴 수준으로 길어지면 40개가 넘는 도움 대화가 쌓이면서 안전 지시가 사실상 작은 비중이 된다. 그 결과 오래도록 협조적이던 맥락에서 갑자기 거절하는 동작이 모델에겐 부자연스럽게 보이고, 안전 정책이 약해진다.

테스트 방식은 phased escalation이다.

  • 먼저 정상적인 대화로 신뢰를 쌓고
  • 가설적 질문으로 경계를 탐색한 뒤
  • 마지막에 더 직접적인 요청으로 수위를 올린다

특히 한쪽은 clean conversation만 유지하고, 다른 쪽은 전체 시도와 점수를 모두 보관하는 두 개의 대화 기록을 쓴다. agent가 거절한 기록은 제거한 채 다시 접근하므로, agent는 이전 거절 맥락을 잃고 attacker는 새로운 각도로 계속 압박할 수 있다.

작성자는 이 접근이 Crescendo paper, OWASP LLM Top 10, Meta GOAT에서 영향을 받았다고 밝히며, 이런 다중 턴 공격이 single-turn benchmark를 통과한 agent도 반복적으로 무너뜨린다고 강조한다.

이 내용을 바탕으로 만든 도구가 오픈소스 agent testing framework Scenario이며, 저장소는 langwatch/scenario다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.