AI Briefing

LLM은 위임할 때 문서를 훼손한다

·2026.05.10 12:33

핵심 내용

DELEGATE-52 벤치마크에서 프런티어 모델도 긴 위임 편집에서 문서 충실도가 크게 떨어졌다.

자세히 보기

DELEGATE-52는 사용자가 LLM에 긴 문서 편집을 위임했을 때 문서 충실도가 얼마나 유지되는지 측정하는 벤치마크다.

52개 전문 영역의 깊이 있는 문서 편집 과제를 포함하며, 시뮬레이션은 20개의 연속 위임 작업으로 구성됐다.

19개 LLM 실험에서 Gemini 3.1 Pro, Claude 4.6 Opus, GPT 5.4 같은 프런티어 모델도 긴 워크플로가 끝날 때 평균적으로 문서 내용의 **25%**를 훼손했다.

문서 훼손은 드문 오탈자 수준이 아니라, 긴 상호작용이 누적될수록 문서가 조용히 망가지는 형태로 나타났다. 문서가 커질수록, 상호작용이 길어질수록, 방해 파일이 많아질수록 성능이 더 떨어졌고, 단순한 에이전트형 도구 사용만으로는 개선되지 않았다.

예시로는 다음과 같은 급격한 열화가 제시됐다.

  • Linux Kernel Architecture 문서: Gemini 3.1 Pro에서 반복 후 충실도가 **79% → 49% → 48% → 48%**로 하락
  • 12-Shaft Twill Diamond 문서: Claude 4.6 Opus에서 **100% → 40% → 27% → 34%**로 하락
  • ActionBoy Palm Tree 문서: GPT-5.2에서 **100% → 31% → 15% → 6%**로 하락

공개 자료로는 **microsoft/DELEGATE52**와 **datasets/microsoft/DELEGATE52**가 제공된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.