오늘, verifiers v1을 출시합니다 (3분 분량)
·2026.07.14 09:00
Prime Intellect가 에이전트 RL 및 평가를 위한 환경 스택인 verifiers v1을 출시했다.
Prime Intellect가 에이전트 기반의 RL(강화학습) 및 평가(evals)를 현대적 환경에 최적화한 verifiers v1을 출시했습니다. 이 시스템은 환경을 taskset, harness, runtime으로 분해하여 복잡한 코딩 및 컴퓨터 사용 작업을 대규모로 실행할 수 있도록 설계되었습니다.
주요 특징은 다음과 같습니다:
- 유연한 구성: Harbor와 같은 기존 프레임워크의 taskset를 재사용하거나, Codex, mini-SWE-agent 등 다양한 harness에서 평가 및 학습이 가능합니다.
- 다양한 런타임 지원: subprocess, Docker, 샌드박스 등 다양한 환경에서 실행할 수 있습니다.
- 효율적인 데이터 관리: 메시지 DAG(Directed Acyclic Graph) 구조를 사용하여 트레이스 크기를 기존 $O(n^2)$에서 $O(n)$으로 줄였으며, 이를 통해 긴 호흡의 에이전트 롤아웃(rollout) 학습을 가능하게 합니다.
또한, verifiers v1은 prime-rl과 직접 연결되어 학습에 활용됩니다. 실제로 GLM-4.5-Air 모델을 ScaleSWE 작업에 적용한 결과, 단 6개의 H200 노드만으로 2일 만에 1,000단계를 완료하는 높은 효율성을 입증했습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.