MirrorCode (8분 읽기)
MirrorCode는 AI가 전체 프로그램을 장기간 자율 재구현할 수 있는지 평가한다.
MirrorCode는 AI 모델이 원본 소스 코드 없이 프로그램 전체를 처음부터 재구현하는 장기 코딩 벤치마크다. 생성된 구현은 비공개 테스트를 포함한 엔드투엔드 테스트에서 원본과 출력을 정확히 일치시켜야 한다.
벤치마크에는 Unix 유틸리티, 데이터 직렬화·쿼리 도구, 생물정보학, 인터프리터, 정적 분석, 암호화, 압축 등 다양한 분야의 25개 프로그램이 포함됐다.
MirrorCode는 기존 소프트웨어 엔지니어링 벤치마크보다 훨씬 큰 추론 예산을 제공한다. 가장 큰 과제 중 하나는 단일 실행에 2,600달러가 들었고, AI가 사람의 개입 없이 19일 동안 작업했다.
과제는 인간 엔지니어에게도 수개월이 걸릴 만큼 어렵지만, 충분한 정보가 제공돼 공정하게 해결할 수 있도록 설계됐다. 또한 인터넷과 원본 코드베이스 접근을 차단하고, 개발 과정에서 볼 수 없는 비공개 테스트를 사용해 치팅과 단순한 출력 룩업 테이블 작성을 막는다.
Claude Opus 4.7은 약 1만6,000줄의 Go 코드와 40개 이상의 명령을 포함한 생물정보학 도구 gotree를 14시간, 251달러에 재구현했다. 연구진은 AI 지원이 없는 인간 엔지니어라면 이 작업에 2~17주가 걸릴 것으로 추정했다.
다만 오픈소스 프로그램이 대상인 만큼 사전학습 데이터 오염 가능성은 남아 있다. 일부 과제는 암기 여부 검사에서 통과한 뒤에도 성공했고, 암기 정황이 확인된 과제는 실패해 성능이 암기만으로 설명되지는 않지만, 그 영향을 완전히 배제할 수는 없다.
현재 리더보드는 Medium·Large 버킷의 15개 프로그램을 Go와 Ada로 각각 구현하는 30개 과제를 대상으로 한다. 각 과제는 10 billion 토큰과 시도당 7일의 예산으로 세 번 실행되며, 공개된 solve@100% 비율은 Claude Fable 5가 64%, GPT-5.6 Sol이 20%, GPT-5.4가 16%, GPT-5.5가 10%다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.