AI Briefing

강화학습으로 멀티턴 AI 에이전트 맞춤화하기

·2026.01.14 06:50

핵심 내용

AWS는 소량 데이터의 온라인 RL로 멀티턴 에이전트 성능을 크게 끌어올렸다.

자세히 보기

AWS AI Labs는 범용 AI 에이전트를 특정 업무 환경에 맞게 빠르게 최적화하기 위해 reinforcement learning(RL) 기반 커스터마이징을 검증했다. 실험 대상은 두 가지였다. 하나는 개인 비서형 에이전트, 다른 하나는 agentic RAG다.

핵심 전제는 비동기 멀티턴 에이전트와 검증 가능한 정답 신호였다. 사람 시뮬레이션에 의존하지 않고, 환경이 직접 제공하는 결과를 reward로 사용해 학습했다. AppWorld 같은 공개 벤치마크와 환경 시뮬레이터를 활용해, RL 방법론 자체에 집중할 수 있게 설계했다.

학습 파이프라인은 두 단계로 구성됐다.

  • 온라인 시뮬레이터가 작업 배치를 받아 rollout trajectory를 생성하고, 각 trajectory에 대해 ground truth 검증으로 reward를 계산한다.
  • 온라인 RL trainer가 이 trajectory와 reward를 받아 actor policy를 갱신하고, 갱신된 가중치를 다시 시뮬레이터의 에이전트에 동기화한다.

AppWorld 실험에서는 파일 시스템과 여러 앱을 오가며 작업을 수행하는 에이전트가, 예를 들어 "파일에 날짜 접두사를 붙이고 현재 연도가 아닌 파일을 휴지통으로 옮기기" 같은 지시를 32개의 API 호출로 분해해 처리했다. 중간에 rename_file이 없으면 move_file로 전환하는 식의 오류 대응, 날짜·시간 파싱, 디렉터리 간 상태 유지까지 수행하며 복잡한 멀티턴 행동을 보여줬다. reward는 마지막 턴에서만 수집되는 sparse reward였지만, 이 방식이 오히려 성능 개선에 유리했다.

결과는 분명했다. 작은 데이터로도 RL이 성능을 크게 끌어올렸다.

  • AppWorld / Qwen2.5-32B-Instruct: base model 39.20% → RL 후 72%
  • 비교 대상인 Sonnet 3.7/4.0은 약 69% 수준
  • NQ / Qwen2.5-3b-Base: 0.106 → 0.406
  • Musique / Llama-3.2-3B-inst: 0.04 → 0.1

여기서 관찰된 중요한 패턴은 큰 base model일수록 RL의 절대 개선 폭이 더 크다는 점이다. 더 나은 rollout을 생성할수록 학습 신호가 좋아지고, 그 결과 RL이 더 잘 작동하는 선순환이 생겼다. 또한 더 강한 base model에 온라인 RL을 적용하면, 현재의 일부 proprietary benchmark를 넘는 성능도 가능할 수 있다고 봤다.

비용 측면에서도 의미가 컸다. AppWorld 72개 예제만으로도 거의 proprietary 수준의 성능에 근접했고, 비용은 1%~2% 수준으로 줄일 수 있었다. 일부 경우에는 첫 training step부터 효과가 나타났고, 30 step 안에 경쟁력 있는 성능에 도달했다.

동시에 RL이 단순 점수 상승만 만드는 것은 아니었다. 모델은 API 문서를 먼저 확인한 뒤 코드를 작성하는 습관을 학습해 코드 오류를 줄였고, exact match가 떨어져도 의미 이해는 유지되는 모습을 보였다. 반면 작은 모델은 "답할 수 없는 질문"을 판별하거나 관련 문맥에서 정답을 추출하는 근본적 reasoning 한계가 있어, 이런 경우에는 RL만으로는 부족하고 distillation이 더 효과적일 수 있다고 정리했다.

실무적 권고는 분명하다. online RL은 assistant agent와 coding agent를 포함한 여러 에이전트 커스터마이징에 투자할 가치가 있다. 다만 성공 조건도 명확하다. 데이터 품질과 포맷 정확성이 중요하고, 더 강한 base model이 더 큰 이득을 내며, 학습 시에는 쉬운 문제보다 더 어려운 task를 우선 선택하는 편이 효율적이다.

향후 연구는 두 축으로 이어진다. 하나는 synthetic data generation과 adaptive data filtering으로 학습 효율을 높이는 것, 다른 하나는 모델 패밀리별 비교, outcome-based reward를 넘어서는 신호 탐색, 파이프라인 최적화처럼 RL 알고리즘 자체를 더 깊게 파고드는 것이다. 함께 언급된 SALT: Step-level advantage assignment for long-horizon agents via trajectory graph와 Reinforcement learning for self-improving agent with skill library는 이 방향의 후속 진전을 보여준다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.