N-Day-Bench – LLMs는 실제 코드베이스에서 실제 취약점을 찾을 수 있을까?
·2026.04.14 06:54
핵심 내용
실제 코드베이스의 알려진 취약점을 찾는 LLM 보안 벤치마크
자세히 보기
N-Day-Bench는 frontier LLM이 실제 저장소 코드에서 알려진 보안 취약점을 찾아낼 수 있는지 평가합니다.
매달 GitHub Security Advisories에서 새 사례를 가져오고, 패치 직전의 마지막 커밋으로 저장소를 체크아웃한 뒤 sandboxed bash shell을 제공합니다. 정적 취약점 탐지는 금방 낡고, 학습 데이터에 섞여 점수가 암기를 측정하는 문제가 생기기 때문에, 이 벤치마크는 월별 갱신으로 오염 창을 관리합니다.
각 사례는 3개의 에이전트로 진행됩니다.
- Curator: advisory를 읽고 정답 키를 작성
- Finder: 평가 대상 모델로, 24개의 shell step 안에서 코드를 탐색하고 구조화된 보고서를 제출
- Judge: 블라인드 제출물을 채점
Finder는 패치를 보지 못한 채 시작하며, sink 힌트에서 출발해 실제 코드 경로를 추적해야 합니다.
대상 저장소는 10k+ stars 기준을 만족해야 하고, 한 저장소가 과도하게 많이 포함되지 않도록 diversity pass가 적용됩니다. merge commit, 다중 저장소 참조, 해석 불가 ref 같은 모호한 advisory는 제외합니다.
현재는 GPT-5.4, Claude Opus 4.6, Gemini 3.1 Pro, GLM-5.1, Kimi K2.5를 평가 중이며, 모든 trace가 공개되어 있습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.