AI 에이전트 품질 검증을 위한 하네스 구축
Claude of Duty: 단일 프롬프트로 AI 에이전트가 만든 브라우저 FPS 게임 및 품질 검증 하네스
·2026.08.14 12:30
핵심 내용
단일 프롬프트로 5.5만 줄의 FPS 게임을 생성하고, 이를 검증하는 자동화 하네스를 구축한 사례를 분석한다.
자세히 보기
Claude of Duty는 단 하나의 프롬프트만으로 Three.js 기반의 55,000줄 규모 FPS 게임을 구축한 프로젝트다. 이 프로젝트의 핵심은 게임 자체보다, AI 에이전트가 작성한 코드의 품질을 주관적 취향이 아닌 측정 가능한 수치로 판정하는 **검증 하네스(Harness)**에 있다.
주요 검증 도구 및 메커니즘:
- imagediff.mjs: 픽셀 단위로 회귀를 감지하는 게이트.
- profile.mjs: 프레임 시간 분포(p50, p95, p99)를 분석하여 성능 병목을 지목.
- baseline.mjs: 비트 단위로 동일한 결과를 보장하는 재현 가능한 캡처 도구.
에이전트 협업 및 관리 규칙: 에이전트 간의 충돌을 방지하기 위해 ARCHITECTURE.md를 유일한 조정 메커니즘으로 사용한다.
- 디렉토리 소유권: 각 에이전트는 지정된 디렉토리만 수정하도록 제한.
- 의존성 및 난수 제어: 외부 패키지 사용을 금지하고 결정론적 난수(
ctx.rng) 사용을 강제하여 재현성 확보. - 모듈 관리: 런타임에
ctx.get()을 통해 상호작용하여 병렬 작업의 안전성 확보.
핵심 교훈: 평균 프레임 수치(p50)는 성능 문제를 은폐할 수 있으므로 p99 등 분포 분석이 필수적이며, 에이전트의 평가가 유의미하려면 결정론적(Deterministic)인 환경이 반드시 선행되어야 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.