LLM 에이전트의 다층 지시 계층
핵심 내용
에이전트 지시 충돌을 최대 **12단계** 권한으로 푸는 **ManyIH**를 제안했다.
자세히 보기
LLM 에이전트는 system 메시지, user 프롬프트, tool 출력, 다른 에이전트의 지시 등 여러 출처의 명령을 동시에 받는다. 서로 충돌할 때는 어떤 지시가 더 높은 권한인지 정확히 판단해야 안전하고 유용하게 동작한다.
기존 instruction hierarchy (IH) 는 보통 5개 미만의 고정된 권한 수준과 system > user 같은 경직된 역할 라벨에 의존한다. 하지만 실제 에이전트 환경에서는 훨씬 더 많은 출처와 맥락에서 충돌이 생기므로, 이런 단순한 계층만으로는 부족하다.
이를 해결하기 위해 저자들은 Many-Tier Instruction Hierarchy (ManyIH) 를 제안한다. 핵심은 권한 수준을 제한된 몇 단계가 아니라 임의로 많은 tier 로 다룰 수 있게 만들어, 복잡한 충돌 상황에서도 상위 권한 지시를 안정적으로 따르게 하는 것이다.
함께 공개한 ManyIH-Bench 는 이 문제를 평가하는 첫 벤치마크다. 이 벤치마크는 최대 12단계 의 충돌 지시를 포함하며, 총 853개 에이전트 과제로 구성된다.
- 427개 코딩 과제
- 426개 instruction-following 과제
- 46개 실제 에이전트 환경을 반영한 테스트
- LLM이 만든 제약을 사람 검증으로 다듬어 현실성과 난도를 높임
실험 결과, 현재의 최전선 모델들도 지시 충돌이 커지면 성능이 크게 떨어졌고, 정확도는 약 40% 수준에 그쳤다. 저자들은 에이전트가 복잡한 지시 충돌을 다루려면, 더 세밀하고 확장 가능한 권한 해석 방법이 필요하다고 강조한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.