AI Briefing

20B 모델, 메모리 독성에도 정답 유지

Had a 20B model converse with itself in my living room. Poisoned the memory and it still found the right answers.

·2026.05.01 00:34

핵심 내용

LoCoMo에서 로컬 20B 모델은 poisoned memory 1,100개 주입 후에도 약 4점만 하락했다.

자세히 보기

LoCoMo 기준으로 로컬 20B 모델을 돌린 결과, 약 2,000개 문항에서 **76%**를 기록했고 비대항 문항에서는 **85%**까지 올랐다.

합성 대화로 두 개의 20B 모델이 몇 시간 동안 상호 대화하며 5,000개+ 메모리를 쌓았고, 그 뒤 spoofed trust score가 붙은 1,100개 poison memory를 넣어도 성능 하락은 약 4점에 그쳤다.

  • adversarial 문항은 정답이 없어 직접 채워 넣고 5개 카테고리 전체를 평가했다.
  • 핵심 reliability 메커니즘은 매번 성능을 떨어뜨려 아키텍처에서 제거했다.
  • 아키텍처 자체는 22점을 더했고, model보다 구조의 영향이 더 컸다.
  • 남은 과제는 memory tier의 decay/promotion 조정과 전통적 RAG 적용이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.