AI 에이전트 메모리는 어떻게 작동하는가
핵심 내용
AI 에이전트 메모리는 context window와 검색형 장기 기억을 결합해 작동한다.
자세히 보기
LLM은 본질적으로 stateless라 한 번의 호출이 끝나면 이전 대화를 기억하지 못한다. 에이전트는 모델 주변의 orchestration이고, 메모리는 다음 프롬프트에 무엇을 다시 넣을지 결정하는 루프다.
가장 단순한 방식은 전체 대화 기록을 그대로 다시 넣는 것이다. 하지만 context window가 한정돼 있어 오래된 턴을 버려야 하고, 실전 시스템은 FIFO 대신 요약, 검색, hierarchical paging 같은 정책을 쓴다.
기억은 보통 working memory와 long-term memory로 나뉜다. 전자는 현재 대화와 툴 호출을 담고, 후자는 임베딩으로 압축해 저장한 뒤 필요할 때 검색한다. 이때 기억은 저장소가 아니라 write, age, supersede, redact, forget이 이어지는 생애주기 문제이며, PII는 저장 전에 마스킹하고 오래된 사실은 supersede로 남겨야 한다. 일부 설계는 메모리 자체를 수정하는 self-editing까지 허용한다.
Embeddings는 텍스트의 의미를 벡터로 바꾸고, 질의도 같은 방식으로 변환해 cosine similarity와 top-k로 가장 가까운 기억을 고른다. 2차원 그림은 설명용 축약일 뿐이고, 실제로는 OpenAI의 text embeddings처럼 1,536 또는 3,072차원 공간에서 같은 원리로 동작한다.
기억의 유형도 네 가지로 정리된다.
- episodic memory: 과거 대화
- semantic memory: 축적된 지식
- procedural memory: 툴 사용 방식
- working memory: 현재 프롬프트
실전 RAG 루프는 매 턴 사용자 입력을 받아 인코딩하고, 관련 기억과 툴 결과를 컨텍스트에 다시 조립해 답변을 만든다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.