AI Briefing

Human-Agent-Society, 지속 학습 인프라 'Reef' 공개

Reef: 에이전트가 서비스되는 동안 모델 가중치와 하네스를 계속 갱신하는 지속 학습 인프라

·2026.09.07 21:00

핵심 내용

Human-Agent-Society가 에이전트 서빙 중 사용자 피드백으로 모델 가중치와 하네스를 실시간 갱신하는 오픈소스 인프라 'Reef'를 공개했다.

1 / 3

자세히 보기

Human-Agent-Society가 에이전트 배포 후 쌓이는 사용자 피드백을 활용해 모델 가중치와 하네스(harness)를 지속적으로 갱신하는 오픈소스 인프라 **'Reef'**를 공개했다. 기존에는 추론 엔진(vLLM, SGLang 등)과 강화학습 프레임워크(slime, veRL 등) 사이에 공백이 있어 팀별로 별도 파이프라인을 구축해야 했지만, Reef는 이 과정을 표준화된 HTTP 엔드포인트로 통합했다.

주요 기능 및 기술 스택

Reef는 SGLang(추론), slime(가중치 학습), cordis(하네스 진화)를 결합하여 서비스 중단 없이 모델을 업데이트한다. 갱신본은 Git 기반 버전 이력으로 관리되며, 평가 결과 성능이 기존 버전보다 우월할 때만 공개되어 회귀 위험을 관리한다. Python 3.10 이상 환경에서 reef-infra 패키지로 설치하며, Git LFS를 필수로 요구한다.

학습 사이클 및 API

학습 과정은 **서빙(Serve) → 관찰(Observe) → 성장(Grow) → 반영(Commit)**의 4단계로 구성된다. OpenAI 및 Anthropic 호환 형식의 요청을 지원하며, x-reef-scenario 헤더로 시나리오를 지정하고 /reef/report 엔드포인트를 통해 숫자 점수나 텍스트 피드백을 전송한다.

적용 레시피 및 벤치마크

다양한 학습 레시피를 제공하며, 자체 모델 서빙 팀에 적합하다. 주요 레시피로는 명시적 보고 없이 트래픽만으로 학습하는 OpenClawRL, 하네스 트리를 진화시키는 harness_evolve, GPU 없이 스킬만 갱신하는 SkillClaw 등이 있다. SAO(Single-Rollout Asynchronous Optimization) 레시피의 경우 Qwen3-30B-A3B 모델 기준, 48회 롤아웃 시점 누적 평균 보상에서 기준 모델(0.458) 대비 0.479로 향상되었으며, GRPO(+DIS)(0.417)보다 높은 성능을 보였다(단, 표본이 작아 참고용).

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.