Reef Infra, 대화 로그 기반 RL 학습 레시피 공개
The next user message can be a training signal. Matching it to the right turn is the hard part
·2026.09.20 01:47
핵심 내용
Reef Infra가 사용자 피드백을 강화학습 신호로 변환하는 OpenClaw-RL 레시피와 세션 매칭 기술을 공개했다.
자세히 보기
Reef Infra가 기록된 추론 트래픽을 재구성하여 사용자 피드백을 강화학습(RL) 신호로 활용하는 OpenClaw-RL 레시피를 공개했다. 이 방식은 완료된 대화 턴과 후속 상태를 별도의 PRM(Process Reward Model) 판정기에 전달하여 학습 데이터를 배치 처리한다.
학습 메커니즘
- 두 가지 업데이트 경로: 판정된 턴은 PPO 스타일 업데이트와 on-policy distillation 항으로 나뉘어 파라미터를 업데이트한다.
- 피드백 해석: "총알 포인트 대신 단계 유지"와 같은 모호한 사용자 지시를 명시적인 학습 신호로 변환한다.
배포 시 주의사항: 세션 매칭
- 세션 식별자 필수: 같은 대화의 호출에는 안정적인
x-reef-tag-session값을 포함해야 한다. - 매칭 실패 리스크: 세션 태그가 없으면 클라이언트가 재전송한 트랜스크립트로 매칭을 시도하지만, 대화 압축(compaction)이나 슬라이딩 윈도우로 인해 매칭이 깨질 수 있다. 매칭되지 않은 턴은 학습 데이터로 수집되지 않아 트래픽은 정상인데 학습 데이터는 없는 상태가 발생할 수 있다.
실험 결과 및 한계
- 저장소에는 학생이 볼드체나 리스트를 거부하는 시뮬레이션 실험이 포함되어 있다. 기록된 실행에서 에이전트는 14번째 세션에서 3회 연속 첫 답변 통과를 달성했다.
- 이는 첫 36개 세션 중 하나의 실행 결과일 뿐, 임의의 사용자 선호도가 빠르게 수렴한다는 증거는 아니다.
- 이 경로는 학습 가능한 모델, GPU 스택, PRM이 필요하며 피드백 추론, 세션 매칭, 파라미터 업데이트가 분리되어 있어 디버깅이 용이하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.