AI Briefing

AI 에이전트 품질 검증을 위한 하네스 구축

Claude of Duty: 단일 프롬프트로 AI 에이전트가 만든 브라우저 FPS 게임 및 품질 검증 하네스

·2026.08.14 12:30

핵심 내용

단일 프롬프트로 5.5만 줄의 FPS 게임을 생성하고, 이를 검증하는 자동화 하네스를 구축한 사례를 분석한다.

자세히 보기

Claude of Duty는 단 하나의 프롬프트만으로 Three.js 기반의 55,000줄 규모 FPS 게임을 구축한 프로젝트다. 이 프로젝트의 핵심은 게임 자체보다, AI 에이전트가 작성한 코드의 품질을 주관적 취향이 아닌 측정 가능한 수치로 판정하는 **검증 하네스(Harness)**에 있다.

주요 검증 도구 및 메커니즘:

  • imagediff.mjs: 픽셀 단위로 회귀를 감지하는 게이트.
  • profile.mjs: 프레임 시간 분포(p50, p95, p99)를 분석하여 성능 병목을 지목.
  • baseline.mjs: 비트 단위로 동일한 결과를 보장하는 재현 가능한 캡처 도구.

에이전트 협업 및 관리 규칙: 에이전트 간의 충돌을 방지하기 위해 ARCHITECTURE.md를 유일한 조정 메커니즘으로 사용한다.

  • 디렉토리 소유권: 각 에이전트는 지정된 디렉토리만 수정하도록 제한.
  • 의존성 및 난수 제어: 외부 패키지 사용을 금지하고 결정론적 난수(ctx.rng) 사용을 강제하여 재현성 확보.
  • 모듈 관리: 런타임에 ctx.get()을 통해 상호작용하여 병렬 작업의 안전성 확보.

핵심 교훈: 평균 프레임 수치(p50)는 성능 문제를 은폐할 수 있으므로 p99 등 분포 분석이 필수적이며, 에이전트의 평가가 유의미하려면 결정론적(Deterministic)인 환경이 반드시 선행되어야 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.