기억보다망각
Benchmarked 4 agent memory systems: Mem0 scores 49% recall (worse than a coin flip), Zep uses 340x more tokens for 15 points improvement. Here's what's actually going on.
핵심 내용
agent memory는 검색·비용·기억 관리에서 모두 병목을 드러냈다.
자세히 보기
Claude Code는 세션 시작 시 CLAUDE.md를 읽고, 전체 파일을 그대로 컨텍스트에 넣는다. 벡터 DB나 의미 검색은 없고, v2.1.59+의 auto memory는 마크다운 파일로 메모를 남긴다. 다만 MEMORY.md는 200줄 상한이 있어 그 이후는 조용히 잘린다.
Mem0는 대화에서 사실을 뽑아 임베딩으로 저장하고 semantic search로 가져오지만, LongMemEval에서 49.0% recall에 그쳤다. 토큰 사용량은 대화당 약 1,764 tokens 수준이다.
Zep은 LongMemEval에서 **63.8%**로 더 낫지만, 대화당 약 600,000 tokens를 써서 Mem0보다 340배 가까운 메모리 비용을 치른다. 작성자는 Zep 팀이 적절한 설정에서는 **75.1%**라고 반박했다고 덧붙인다.
Letta/MemGPT는 컨텍스트 윈도우를 RAM처럼, 외부 저장소를 디스크처럼 다루는 방식이다. 벤치마크에서는 약 **83.2%**로 가장 좋지만, 메모리 작업 자체에 추론 토큰을 계속 쓰기 때문에 "무엇을 기억할지"를 판단하는 데 비용이 들어간다.
핵심 결론은 단순하다. 지금의 에이전트 메모리는
- 너무 단순해서 검색이 안 되거나
- 너무 비싸서 토큰을 과소비하거나
- 너무 똑똑해서 기억 관리에 계산력을 낭비한다.
문제는 결국 기억이 아니라 망각이며, 사람처럼 중요한 것만 남기고 나머지를 잊는 메커니즘이 아직 없다는 점이 병목이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.