AI Briefing

쇼핑봇도 훈련한다

Ecom-RLVE: Adaptive Verifiable Environments for E-Commerce Conversational Agents

·2026.04.16 09:00

핵심 내용

8개 verifiable e-commerce 환경에서 RL로 쇼핑 에이전트를 훈련한 결과.

자세히 보기

RLVE를 단일 턴 추론 문제에서 멀티턴, 툴-어그먼트 e-commerce 대화로 확장했다.

  • 8개 환경: product discovery, substitution, cart building, returns, order tracking, policy QA, bundle planning, multi-intent journey
  • 12축 난이도 커리큘럼: 제약 수, 누락 정보, distractor 비율, 재고 변경, 턴 예산, 노이즈, retrieval depth, 정책 복잡도 등을 함께 조절
  • 보상은 전부 algorithmically verifiable하게 계산: task reward, efficiency reward, hallucination penalty
  • 잘못된 JSON, 불법 tool call 같은 invalid output은 즉시 실패 처리

핵심 데모는 Cart Building (E_CART). 제품 검색, variant 선택, 장바구니 추가, clarification dialogue를 모두 거치며, 정답은 (product_id, variant_id, qty) 단위로 검증한다. 제품은 카테고리별로 USB-C / Lightning 같은 자연스러운 변형을 합성해 난도를 높였다.

훈련 결과도 제시했다. Qwen 3 8B를 DAPO로 300 step 학습했고, C1 ⊂ C2 ⊂ C4 ⊂ C8 형태의 환경 확장과 adaptive scheduling이 안정적인 학습 신호를 만든다고 보고했다. 사용자 시뮬레이터는 Qwen3.5 9.7B를 사용했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.