Google Cloud, Gemini RLFT 맞춤화 모범 사례 가이드 공개
핵심 내용
Google Cloud가 보상 함수 기반 Gemini RLFT 서비스의 모범 사례 가이드를 공개했다.
자세히 보기
Google Cloud가 Gemini 모델을 라벨링 데이터 대신 사용자 정의 보상 함수(reward function)로 맞춤화할 수 있는 Reinforcement Learning Fine-Tuning(RLFT) 서비스의 모범 사례 가이드를 공개했습니다. 이 관리형 서비스는 복잡한 인프라와 모델 내부 구조를 처리하며, 결과 검증은 쉽지만 명시적으로 시연하기 어려운 작업에 Gemini를 적응시키는 데 초점을 맞춥니다.
RLFT 작동 방식
RLFT는 정답 예시에 의존하는 지도 미세 조정(SFT)과 달리, 모델이 여러 후보 응답을 생성하고 사용자 정의 보상으로 점수를 매긴 후 높은 점수의 출력을 선호하도록 모델을 업데이트합니다. 전체 과정이 관리형으로 제공되며, 사용자는 프롬프트와 보상 함수만 제공하면 됩니다. 주요 특징은 다음과 같습니다:
- 자체 출력 학습: 외부 대상을 복사하는 대신 기존 역량을 개선하므로, 관련 없는 기능의 혼란을 최소화합니다.
- 결과 기반 보상: 올바른 결과를 달성한 모든 응답에 보상을 부여하여, 여러 유효한 해답이 존재하는 작업에 적합합니다.
- 역량 증폭: 간헐적인 성공을 신뢰성 있게 만들지만, 모델이 전혀 보여주지 않은 기술을 가르칠 수는 없습니다.
RLFT 사용 시점
가이드는 대부분의 적응 요구를 처리하는 프롬프트 엔지니어링과 SFT를 먼저 시도할 것을 권장합니다. RLFT는 다음 상황에서 가장 효과적입니다:
- 응답을 평가하는 비용은 낮지만 작성하는 비용은 높은 경우
- 충실도(faithfulness)나 스키마 유효성 등 주요 지표에서 SFT가 정체된 경우
- 단일 참조 대상이 불이익을 줄 수 있는 여러 동등한 정답이 존재하는 경우
기본 모델의 성공률이 너무 낮아 RL이 효과를 내기 어려운 경우, Continuous Tuning을 통해 RL을 계속하기 전에 SFT를 가벼운 웜 스타트로 사용하는 2단계 SFT → RLFT 접근법을 제안합니다.
주요 사용 사례
초기 도입자들은 RLFT를 다양한 영역에 적용했습니다:
- AI 기반 NPC: Gemini autorater를 사용하여 페르소나와 흐름을 점수화함으로써 게임 대화의 언어 드리프트와 반복 루프를 제거합니다.
- 구조화된 엔티티 추출: rule-based precision/recall reward를 적용하여 인보이스 등 노이즈가 많은 문서의 필드 단위 정확도를 향상시킵니다.
- 콘텐츠 모더레이션: 형식 검증과 결정적 채점기를 결합하여 복잡한 정책 준수를 강제하고 오탐지(false positives)를 줄입니다.
- 코드 실행: SQL 또는 API 호출을 샌드박스에서 실행하는 code-execution reward를 사용하여 쿼리가 컴파일되고 올바른 결과를 반환하는지 보장합니다.
- 슬라이드 생성: HTML/CSS 덱을 렌더링하여 시각적 디자인과 레이아웃 무결성을 점수화하며, 오버플로우와 스타일 오류를 방지합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.