AI Briefing

기억보다망각

Benchmarked 4 agent memory systems: Mem0 scores 49% recall (worse than a coin flip), Zep uses 340x more tokens for 15 points improvement. Here's what's actually going on.

·2026.04.15 22:47

핵심 내용

agent memory는 검색·비용·기억 관리에서 모두 병목을 드러냈다.

자세히 보기

Claude Code는 세션 시작 시 CLAUDE.md를 읽고, 전체 파일을 그대로 컨텍스트에 넣는다. 벡터 DB나 의미 검색은 없고, v2.1.59+의 auto memory는 마크다운 파일로 메모를 남긴다. 다만 MEMORY.md는 200줄 상한이 있어 그 이후는 조용히 잘린다.

Mem0는 대화에서 사실을 뽑아 임베딩으로 저장하고 semantic search로 가져오지만, LongMemEval에서 49.0% recall에 그쳤다. 토큰 사용량은 대화당 약 1,764 tokens 수준이다.

Zep은 LongMemEval에서 **63.8%**로 더 낫지만, 대화당 약 600,000 tokens를 써서 Mem0보다 340배 가까운 메모리 비용을 치른다. 작성자는 Zep 팀이 적절한 설정에서는 **75.1%**라고 반박했다고 덧붙인다.

Letta/MemGPT는 컨텍스트 윈도우를 RAM처럼, 외부 저장소를 디스크처럼 다루는 방식이다. 벤치마크에서는 약 **83.2%**로 가장 좋지만, 메모리 작업 자체에 추론 토큰을 계속 쓰기 때문에 "무엇을 기억할지"를 판단하는 데 비용이 들어간다.

핵심 결론은 단순하다. 지금의 에이전트 메모리는

  • 너무 단순해서 검색이 안 되거나
  • 너무 비싸서 토큰을 과소비하거나
  • 너무 똑똑해서 기억 관리에 계산력을 낭비한다.

문제는 결국 기억이 아니라 망각이며, 사람처럼 중요한 것만 남기고 나머지를 잊는 메커니즘이 아직 없다는 점이 병목이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.