가장 주목받는 AI agent benchmark를 악용하기
·2026.04.12 04:15
핵심 내용
8개 주요 AI agent benchmark가 모두 점수 조작에 취약하다고 밝힌다.
1 / 2
자세히 보기
UC Berkeley 연구진이 8개 주요 AI agent benchmark를 자동 스캐닝해 본 결과, 모든 benchmark가 사실상 악용 가능하다는 점을 확인했다. 핵심 메시지는 점수판이 능력을 측정하는 게 아니라, 평가 파이프라인의 허점을 측정하고 있다는 것이다.
대상은 SWE-bench, WebArena, OSWorld, GAIA, Terminal-Bench, FieldWorkArena, CAR-bench였다. 연구진의 에이전트는 각 벤치마크에서 실제로 동작하는 exploit를 만들고, 공식 evaluator를 그대로 통과시켜 거의 만점을 얻었다.
주요 사례는 다음과 같다.
- Terminal-Bench:
curl,uvx,pip,python같은 시스템 바이너리를 가로채는 wrapper/trojan으로 **89/89, 100%**를 달성했다. - SWE-bench Verified / Pro:
conftest.py의 pytest hook, Django의unittestmonkey patch, parser overwrite로 테스트 결과를 조작해 500/500, 731/731을 얻었다. - WebArena: Chromium이
file://URL로 로컬 설정 파일을 읽을 수 있어 task config 안의 정답을 직접 노출했다. 여기에 DOM injection과 prompt injection까지 겹쳐 812개 task가 사실상 노출됐다. - FieldWorkArena: 검증 함수가 답안 내용이 아니라 마지막 메시지가 assistant인지만 확인했다. 그래서
{}같은 출력만으로도 **890/890, 100%**가 가능했다. - OSWorld: 공개된 gold file을 그대로 내려받아 evaluator가 비교하도록 만들거나, 시스템 상태를 직접 맞추는 방식으로 73% 이상을 쉽게 얻었다. 일부는
eval()사용으로 평가 머신에서 코드 실행까지 가능했다. - GAIA: 공개 정답과 지나치게 느슨한
normalize_str비교 때문에 정답이 사실상 lookup table처럼 동작했다. 쉼표 처리 버그와 100% 방지용 필터도 우회 가능했다.
글은 개별 버그 나열을 넘어, benchmark score가 실제 능력과 분리돼 있다는 점을 강하게 경고한다. 모델의 추론 능력보다, 평가 환경의 권한 분리·정답 은닉·검증 로직 설계가 훨씬 중요하다는 결론이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.