자율 연구 시스템 Praxist 공개
Praxist: 기존 프로젝트를 넘겨받아 방법과 구조까지 바꾸며 개선하는 자율 연구 시스템
핵심 내용
Sapient Intelligence가 기존 프로젝트를 자율적으로 개선하는 연구 시스템 Praxist를 공개했으며, MLE-bench에서 Claude Code 대비 약 1/12 비용으로 더 높은 성과를 기록했다고 밝혔다.
자세히 보기
Sapient Intelligence가 측정 가능한 지표를 가진 연구 프로젝트를 자율적으로 개선하는 시스템 Praxist를 공개했다. Praxist는 하이퍼파라미터 튜닝을 넘어 방법론, 아키텍처, 전략 자체를 변경하며, 병렬로 실행되는 연구 피어(peer)들이 생성한 결과를 평가자가 구조화된 증거로 변환하고 기획 패널이 이를 종합해 다음 세대의 연구 의제를 설정하는 루프를 반복한다.
AutoML과의 차별점 및 작동 원리
Praxist는 미리 정의된 탐색 공간 내 파라미터만 조정하는 AutoML과 달리, Deep Innovation Gate와 Quality-Diversity 할당을 통해 국소 최적점을 탈출하고 검증된 메커니즘과 증거를 다음 세대로 계승한다. Codex나 Claude Code를 조작 인터페이스로 활용하되, 대화형 에이전트 기능을 대체하지 않고 그 위에 지속되는 연구 루프와 수명주기 제어를 얹는 구조다.
MLE-bench 성능 및 비용 효율성
연구진이 공개한 논문 결과에 따르면, 표준화된 75개 과제로 구성된 MLE-bench에서 Praxist는 메달 **60개(80.0%)**를 획득했으며 그중 49개가 금메달이다. 이는 비교 대상인 Claude Opus 4.8 기반 Claude Code 베이스라인(메달 55개, 금메달 34개)보다 높은 수치다. 특히 모델 지출 비용은 Praxist가 3,054달러로, Claude Code의 38,370달러 대비 약 1/12 수준으로 측정되었다. 다만 이는 개발사 자체 측정치이므로 실제 도입 시 재검증이 필요하다.
적용 조건 및 제한 사항
Praxist는 이미 돌아가는 베이스라인과 자동화된 평가 경로가 존재하며, 최선의 개선 경로가 불분명한 연구팀에 적합하다. 초기 탐색 단계나 지표로 우열을 가릴 수 없는 작업에는 부적합하며, 과학적 가정이나 도메인 제약은 과제 프로젝트 측이 소유하고 Praxist는 오케스트레이션과 증거 프로토콜만 담당한다. 현재 CPython 3.11/3.12 리눅스 환경이 공식 지원되며, macOS 등은 호환 목표로 분류된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.