AI Briefing

RISED, 루브릭 기반 LLM 에이전트 훈련으로 다양한 환경 최고 성능 달성

·2026.10.06 09:00

핵심 내용

RISED가 루브릭 기반 데이터 선택과 자기 증류로 다양한 환경에서 최고 평균 통과율을 달성했다.

자세히 보기

연구진이 다양한 대화형 환경에서 단일 LLM 에이전트를 훈련하기 위한 프레임워크 RISED(Rubrics for Agentic Multi-Environment Selection and Self-Distillation)를 공개했다. 기존 방법은 스칼라 보상에 의존해 환경 간 관계를 포착하지 못하고, 롤아웃 그룹이 모두 성공하거나 실패할 때 대비 정보를 제공하지 못하는 한계가 있었다. RISED는 텍스트 기반 루브릭을 활용해 데이터 선택과 정책 감독을 모두 수행한다.

RISED 작동 방식

프레임워크는 LLM 판정기를 사용해 각 롤아웃을 환경 간 공유되는 사전 정의된 루브릭 어휘로 태깅한다. 이 루브릭 프로파일은 두 가지 주요 기능을 수행한다.

  • 데이터 선택: 혼합 환경 배치의 전체 행동 구성과 일치하면서 이미 선택된 데이터와의 중복을 최소화하는 학습 데이터를 선별한다.
  • 자기 증류(Self-Distillation): 긍정 루브릭(원하는 행동 설명)은 온폴리시 자기 증류 교사에게 특권 컨텍스트를 제공해 토큰 수준 감독을 수행한다. 부정 루브릭(원치 않는 행동 설명)은 반복되는 실패 패턴을 피하도록 후속 롤아웃 생성을 유도한다.

성능 및 분석

다양한 모델 백본에서 RISED는 환경 전반에 걸쳐 최고의 평균 통과율을 기록했으며, 모든 개별 환경에서 1위 또는 2위를 차지했다. 루브릭 기반 분석은 이러한 성능 향상과 동반되는 행동 변화를 구체적으로 규명하며, 단순 보상 신호를 넘어선 텍스트 피드백의 유용성을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.