구글 리서치, RL 기반 검색 증류 기술 R4T 공개
R4T(Retrieve-for-Train): RL로 찾은 질의 팬아웃(fan-out) 행동을 경량 확산 검색기(Diffusion Model)로 컴파일하는 연구
·2026.09.22 15:30
핵심 내용
구글 리서치와 UIUC가 RL로 학습한 질의 팬아웃 행동을 53.9M 파라미터 확산 모델로 증류해 검색 지연을 12~20배 단축한 R4T를 공개했다.
1 / 9
자세히 보기
구글 리서치와 UIUC는 R4T(Retrieve-for-Train) 연구를 통해 강화학습(RL)을 추론 엔진이 아닌 학습 데이터 생성 도구로 활용하는 새로운 접근법을 제시했다. 이 연구는 집합 수준(Set-level) 품질이 중요한 생성형 검색(Generative Retrieval)에서 발생하는 다양성 및 커버리지 문제를 해결하기 위해 개발되었다.
핵심 방법론: RL을 통한 데이터 컴파일
기존 제로샷 LLM은 의역 붕괴(Paraphrastic Collapse)와 높은 추론 지연이라는 한계가 있었다. R4T는 이 문제를 해결하기 위해 3단계 파이프라인을 적용한다.
- FOLM 학습: Gemma3-4B 또는 Qwen3-4B를 사용해 질의당 10개의 하위 질의를 생성하는 팬아웃 언어 모델(FOLM)을 RL(GRPO)로 학습한다.
- 합성 데이터 생성: 고보상 궤적(OAR, WSCR 보상 기준)을 활용해 사람 라벨 없이 고품질 합성 지도 데이터를 생성한다.
- 확산 모델 증류: FOLM의 행동을 53.9M 파라미터의 경량 확산 모델(DiT 기반)로 증류하여, 추론 시 자기회귀 과정 없이 단일 패스(Single Pass)로 검색 방향을 생성한다.
성능 및 효율성
Polyvore 및 Music 데이터셋 실험에서 R4T는 기존 제로샷 및 Best-of-N 기준선을 상회했다.
- 정확도: R4T-FOLM(Gemma)은 Polyvore에서 평균 점수 49.1로 Best-of-N(40.9)을 크게 앞섰다.
- 속도: 확산 모델(R4T-Diffusion)은 자기회귀 LLM 대비 추론 지연을 12~20배 단축했다. 배치 크기 8~1024에서 0.07~4.21초가 소요되는 반면, LLM은 1.46~50초가 소요된다.
- 다양성: R4T-Diffusion(Gemma)은 Vendi Score 46.2로 다양성을 유지하면서도 Hit@5K 54.1을 달성해 커버리지-다양성 트레이드오프를 개선한다.
시사점 및 한계
R4T는 복잡한 System 2 탐색(RL 학습)을 경량화된 System 1 추론(확산 모델)으로 컴파일하는 패턴을 보여준다. 다만, 대규모 동적 DB에서의 RL 학습 오버헤드, 보상 설계의 주관성, 그리고 LLM-as-a-Judge 평가의 편향 의존성은 한계로 지적된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.