AI Briefing

멀티 에이전트 연구 시스템을 만든 방법

·2025.06.13 00:00

병렬 서브에이전트와 프롬프트·평가 설계가 Research 성능을 끌어올렸다.

Claude의 Research 기능은 웹, Google Workspace, 각종 integration을 넘나들며 복잡한 질문을 처리한다. 핵심은 하나의 에이전트가 끝까지 혼자 일하는 방식이 아니라, LeadResearcher가 계획을 세우고 여러 Subagent를 병렬로 띄워 서로 다른 방향을 동시에 파고드는 orchestrator-worker 구조다.

이 접근이 강한 이유는 연구 자체가 본질적으로 비선형적이기 때문이다. 답을 미리 정해진 경로로 찾을 수 없고, 조사 중 발견한 단서를 따라 계속 전략을 바꿔야 한다. 서브에이전트는 각자 독립된 context window에서 다른 축을 탐색한 뒤, 중요한 정보만 압축해 lead agent에 넘겨주며, 이렇게 하면 path dependency를 줄이고 더 넓고 깊게 탐색할 수 있다.

Anthropic 내부 평가에서는 Claude Opus 4 lead agent와 Claude Sonnet 4 subagent 조합이 단일 Claude Opus 4보다 연구 eval에서 90.2% 더 높은 성능을 냈다. 예를 들어 S&P 500 Information Technology 섹터 기업들의 이사회 멤버를 찾는 과제에서, 멀티 에이전트 시스템은 작업을 분해해 병렬 탐색으로 정답을 찾았지만 단일 에이전트는 느린 순차 검색에 막혔다.

성능 향상의 큰 이유는 결국 토큰을 더 많이, 더 효율적으로 쓰기 때문이다. Anthropic 분석에 따르면 BrowseComp 평가의 성능 분산 중 **95%**는 세 가지 요인으로 설명됐고, 그중 **토큰 사용량만으로 80%**를 설명했다. 실제로 agents는 chat보다 약 4배, multi-agent 시스템은 chat보다 약 15배 더 많은 토큰을 사용하며, Claude Sonnet 4로의 업그레이드는 Claude Sonnet 3.7의 토큰 예산을 두 배로 늘리는 것보다 더 큰 성능 향상을 낸다고 설명한다.

대신 비용은 빠르게 커진다. 그래서 이런 구조는 가치가 높은 작업, context window를 넘는 대규모 정보 탐색, 여러 complex tool을 다뤄야 하는 작업에 특히 맞는다. 반면 공유 context가 필수이거나 에이전트 간 의존도가 높은 coding 작업처럼 병렬화가 잘 안 되는 영역에는 덜 적합하다.

구조는 다음처럼 동작한다.

  • 사용자가 질문을 넣으면 LeadResearcher가 접근 전략을 짠다.
  • 계획은 Memory에 저장해, context window가 200,000 tokens를 넘어서 잘려도 유지한다.
  • LeadResearcher가 여러 Subagent를 만들어 각기 다른 하위 과제를 맡긴다.
  • Subagent는 web search를 반복하고 결과를 평가한 뒤, 필요한 경우 더 파고든다.
  • 충분한 정보가 모이면 결과가 CitationAgent로 넘어가 문서와 보고서를 바탕으로 인용 위치를 찾는다.
  • 최종 답변은 citations와 함께 반환된다.

프롬프트 엔지니어링에서 배운 점도 분명하다. 에이전트는 쉽게 과도하게 행동하거나, 쓸데없이 긴 검색어를 쓰거나, 이미 충분한 결과가 있어도 계속 탐색하거나, 서로 작업을 중복한다. 그래서 lead agent에게는 단순 지시가 아니라 subtask, output format, tool/source guidance, task boundary를 명시적으로 주고, query complexity에 따라 1 agent에서 10명 이상까지 규모를 조절하도록 규칙을 넣었다.

특히 효과가 컸던 원칙은 다음과 같다.

  • Think like your agents: 실제 prompts와 tools로 시뮬레이션해 실패 모드를 직접 관찰했다.
  • Teach the orchestrator how to delegate: 서브에이전트가 겹치지 않게 역할을 쪼갰다.
  • Scale effort to query complexity: 간단한 fact-finding은 1 agent, 복잡한 연구는 10개 이상까지 확장했다.
  • Tool design and selection: web이 아닌 Slack에만 있는 정보를 web search로 찾는 식의 오류를 막기 위해 tool 설명과 선택 기준을 엄격히 만들었다.
  • Let agents improve themselves: Claude 4 모델이 prompt engineering과 tool description 개선을 스스로 제안하게 했다.
  • Start wide, then narrow down: 처음엔 짧고 넓게 검색한 뒤 점점 좁혔다.
  • Guide the thinking process: extended thinkinginterleaved thinking을 scratchpad처럼 써서 계획과 재평가를 수행하게 했다.
  • Parallel tool calling: lead agent는 3-5개 subagent를 병렬로 띄우고, subagent도 3개 이상 tool을 동시에 사용하게 해 complex research 시간을 최대 90% 줄였다.

평가도 일반 단일 에이전트와 다르게 설계해야 했다. 멀티 에이전트는 같은 입력에도 매번 다른 경로를 택할 수 있으므로, 고정된 정답 경로만 보면 안 된다. 대신 어떤 valid path를 택하든 목표를 달성하는지, tool 사용과 탐색이 적절한지, 그리고 결과 품질이 충분한지를 보도록 해야 한다. 이 시스템은 결국 연구를 더 잘하기 위해, 그리고 그 연구를 평가 가능하게 만들기 위해, 병렬성·도구 설계·프롬프트·관찰성을 함께 다듬은 구조다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.