AI Briefing

EVMbench 소개

·2026.02.18 09:00

AI 에이전트의 Smart Contract 취약점 탐지, 수정 및 악용 능력을 평가하는 벤치마크 EVMbench가 공개되었다.

AI 에이전트가 블록체인 환경에서 Smart Contract의 취약점을 탐지, 수정 및 악용하는 능력을 측정하기 위한 벤치마크인 EVMbench가 공개되었다. Paradigm과 협력하여 개발된 이 벤치마크는 40개의 audit에서 선별된 117개의 취약점과 Tempo 블록체인의 보안 시나리오를 기반으로 한다.

EVMbench는 세 가지 핵심 모드로 에이전트의 역량을 평가한다:

  • Detect: Smart Contract 저장소를 감사하여 실제 취약점을 찾아내는 능력 측정.
  • Patch: 기존 기능을 유지하면서 취약점을 제거하는 능력 측정.
  • Exploit: 샌드박스 환경에서 자금을 탈취하는 공격을 성공시키는 능력 측정.

성능 평가 결과, Exploit 모드에서 GPT-5.3-Codex는 71.0%의 점수를 기록하며, 약 6개월 전 출시된 GPT-5(33.3%) 대비 비약적인 성능 향상을 보였다. 다만, DetectPatch 모드에서는 여전히 에이전트가 복잡한 문제를 해결하는 데 어려움을 겪고 있다.

평가의 객관성과 재현성을 위해 Rust 기반의 harness를 개발하였으며, Anvil 환경을 활용해 격리된 로컬 환경에서 테스트를 수행한다. 다만, 실제 환경의 모든 복잡성을 반영하지 못하거나, Detect 모드에서 false positive를 완벽히 구분하기 어렵다는 등의 한계점도 존재한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.