pi-autoresearch: Karpathy의 "AI 자율 실험" 아이디어를 범용화한 오픈소스
핵심 내용
pi-autoresearch가 Karpathy식 자율 실험을 범용 최적화 도구로 확장했다.
자세히 보기
pi-autoresearch는 터미널 AI 코딩 에이전트 pi 위에서 돌아가는 Extension + Skill 패키지로, Karpathy의 autoresearch 개념을 특정 모델 학습이 아닌 범용 최적화 루프로 확장한다.
핵심은 "시도하고 → 측정하고 → 좋아지면 유지, 아니면 버리고 → 반복"하는 구조다. pi의 Extension은 도구를 추가하고, Skill은 그 도구를 어떤 순서로 써야 하는지 정의한다. 덕분에 pi install <github-url> 한 줄로 설치해 기존 워크플로우에 붙일 수 있다.
Karpathy의 원래 autoresearch는 2026년 3월 공개된 미니멀 실험으로, 에이전트에게 train.py를 수정하게 한 뒤 5분 훈련 후 validation loss가 좋아지면 keep, 아니면 discard하는 방식이었다. 밤새 반복해 아침에 로그와 개선된 모델을 받는 아이디어였지만, NVIDIA GPU 전용이고 LLM 학습에만 국한된 한계가 있었다.
pi-autoresearch는 이 제약을 풀어, 측정 가능한 대상이면 무엇이든 최적화하게 만든다.
- 테스트 속도:
pnpm test - 번들 사이즈:
pnpm build && du -sb dist - LLM 훈련:
uv run train.py - Lighthouse 점수:
lighthouse --output=json
장시간 실험에서 컨텍스트가 끊겨도 이어갈 수 있도록 세션 상태를 두 파일로 보존한다.
autoresearch.jsonl: 모든 실험의 append-only 로그autoresearch.md: 목표, 시도, 막힌 점, 핵심 성과 요약
새 에이전트가 투입돼도 이 두 파일만 읽으면 이전 맥락을 복원할 수 있어, 사실상 외부 메모리 역할을 한다.
또한 3회 이상 실험한 뒤에는 MAD(Median Absolute Deviation) 기반 confidence score를 계산해, 개선이 실제인지 노이즈인지 구분한다.
- 🟢 ≥ 2.0×: 개선 가능성이 높음
- 🟡 1.0–2.0×: 노이즈보다 낫지만 미미
- 🔴 < 1.0×: 노이즈 범위, 재실행 권장
최적화가 정합성을 망가뜨리지 않도록 autoresearch.checks.sh를 붙이면 벤치마크 뒤에 테스트, 타입체크, 린트가 자동으로 돈다. 빠른 성능 개선이 코드 품질을 깨는 상황을 시스템 차원에서 막는 셈이다.
실험을 마치면 autoresearch-finalize 스킬이 keep된 결과를 논리적 changeset으로 묶어 독립 git 브랜치로 분리한다. 파일 충돌이 없도록 나눠서, 각 브랜치를 따로 리뷰하고 머지할 수 있다.
비용 통제도 고려했다. 자율 루프가 토큰을 계속 쓰는 문제를 막기 위해 API 키 한도와 **maxIterations**를 제공한다.
결국 이 프로젝트는 Karpathy의 "AI가 알아서 연구한다"는 아이디어를 실제 개발 현장에서 쓸 수 있는 형태로 바꾼 시도다. 세션 복원, 통계적 신뢰도 판단, 정합성 검증, Git 네이티브 정리까지 포함해, 밤에 돌려놓고 아침에 PR을 검토하는 워크플로우를 현실화하려는 점이 핵심이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.