Latent Briefing: KV Cache 압축으로 구현하는 효율적인 Multi-Agent 메모리 공유
핵심 내용
KV cache 압축으로 multi-agent 간 메모리를 공유해 토큰을 최대 49% 줄였다.
자세히 보기
Multi-agent 시스템은 협업과 추론에는 강하지만, 오케스트레이터와 worker 사이에 중간 reasoning이 계속 쌓이면서 토큰 효율이 급격히 나빠진다. 기존의 LLM summarization은 느리고, RAG는 brittle하며, 모든 컨텍스트를 그대로 넘기면 비용과 지연이 커진다.
여기서 제안한 Latent Briefing은 텍스트 요약 대신 모델의 attention 패턴을 이용해 중요한 부분만 남기고 나머지를 KV cache 수준에서 버린다. 즉, 워커가 실제로 필요로 하는 오케스트레이터의 누적 기억만 압축해 전달하는 방식이다.
기반이 된 것은 Attention Matching(AM) 기반 KV cache compaction이다. 원래 AM은 각 layer와 head를 독립적으로 처리해, Qwen3-14B 기준으로 40 layers × 8 KV heads = 320개의 순차적 solve가 필요했다. 각 head는 토큰 선택, NNLS 기반 β 추정, ridge regression 기반 C2 복원을 거치며, 품질은 좋지만 30초 이상 걸려 실시간 에이전트에는 부적합했다.
이를 위해 세 가지를 바꿨다.
- Task-guided query vectors: context 자체에서 query를 뽑지 않고, 현재 worker call의 task prompt에서 query를 생성해 해당 작업에 중요한 기억을 우선 보존했다.
- Shared token selection: head별 top-k가 아니라 모든 layer/head의 점수를 합산한 global score로 공통 마스크를 만들었다. Qwen3-14B에는 최적화된 head budget이 없어 uniform weighting을 썼지만, 여러 head의 합의가 충분히 유효했다.
- MAD normalization thresholding: 고정 개수 대신 median + threshold · MAD를 넘는 위치를 유지해, 문서와 질문 난이도에 따라 압축 강도를 조절했다.
이 공유 마스크 덕분에 320개의 solve를 batched tensor operation으로 묶을 수 있었고, adaptive batch sizing과 KV prefix caching으로 90%+의 이전 표현을 재사용했다. in-place softmax, 단계별 순차 실행, CPU offloading, chunked prefills, OOM 시 batch size 자동 절반 축소까지 적용해, compaction overhead를 30초+ → 중앙값 약 1.7초로 줄였다.
실험은 Claude Sonnet 4 orchestrator와 Qwen-14B worker 조합으로 LongBench v2에서 수행했다. 총 126개 질문, 0~100k 토큰 범위의 문서를 대상으로 baseline과 t = -1.0, 0.0, 1.0, 2.0 네 가지 threshold를 비교했다. 결과는 다음과 같다.
- 정확도는 baseline과 동등하거나 더 좋았고, 전체 조건에서 최대 +3pp 향상됐다.
- 최적 threshold에서는 worker token이 42–57% 감소했고, total token은 21–31% 줄었다.
- medium length(32k–100k) 문서에서는 median token savings가 **최대 49%**까지 나왔다.
- worker model token consumption은 65% 감소했다.
threshold별로 최적점이 달랐다. 긴 문서에서는 넓은 coverage가 필요해 t = -1.0 같은 약한 compaction이 좋았고, 어려운 질문에서는 오케스트레이터의 speculative reasoning이 노이즈가 되므로 t = 2.0 같은 강한 compaction이 더 잘 맞았다. 반대로 짧고 쉬운 문서에서는 t = 1.0 정도의 중간 압축이 가장 안정적이었다.
제약도 분명하다. Claude Sonnet 4 오케스트레이터는 비결정적이라 동일 질문에서도 decomposition이 달라질 수 있고, 실험은 LongBench v2 하나에만 한정됐다. 다만 전반적으로 Latent Briefing은 multi-agent memory sharing을 텍스트 요약이나 retrieval이 아니라 representation-level compaction으로 해결해, 정확도를 유지하면서 실시간에 가까운 토큰 절감을 달성했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.