AI Briefing

FLEET, 보상 인식 MCTS로 Best-of-N 샘플링 개선

Adding memory to search instead of sampling in reward maximization tasks [R]

·2026.10.02 21:04

핵심 내용

FLEET은 보상 이력 기반 MCTS로 GSM8K 샘플링 반복을 절반, LiveCodeBench는 9회로 줄였다.

자세히 보기

FLEET은 과거 외부 보상 이력을 반영해 Best-of-N 생성의 샘플링 과정을 개선하는 신규 알고리즘이다. 무작위 샘플링 대신 보상을 특정 토큰에 귀속하고 **Monte Carlo Tree Search (MCTS)**를 활용해 이후 실행의 로짓을 조정한다.

작동 원리

모델의 불확실성을 나타내는 높은 엔트로피와 바렌트로피를 추적해 분기점을 식별한다. 이 상태들은 보상 이력과 전이 데이터를 메타데이터로 포함해 벡터 스토어에 저장된다. 코사인 유사도를 이용한 검색은 높은 유사성이 낮은 KL 발산에 대응하도록 보장해 의미 있는 토큰을 보존한다. 이후 FLEET은 MCTS를 수정해 상위 k개 토큰을 순위를 매기고 비최적 토큰에 페널티를 부여한 뒤 디코딩 전략을 적용한다.

성능 결과

Llama 3.2 3B 모델과 그리디 디코딩을 사용했으며, 비최적 토큰의 확률을 사실상 0으로 만드는 페널티를 적용했다.

  • GSM8K: 샘플링 기준선 도달에 필요한 반복 횟수를 절반으로 줄였다 (7개 작업 추가 해결).
  • LiveCodeBench v6 (easy split): 동일한 예산 하에서 점수를 0.59에서 0.69로 높였고, 기준선 도달에 9회 반복으로 충분했다 (기존 32회 대비).

메타데이터 스토어는 다른 작업의 사전 정보로 보존하거나 SFT/RL 학습을 강화하는 데 활용할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.