AI Briefing

LLM 암기 용량 측정법 및 스케일링 법칙 연구

[Paper] How much do language models memorize?

·2026.07.07 18:32

언어 모델의 암기(Memorization)와 일반화(Generalization)를 분리하여 모델의 용량을 측정하는 새로운 방법론을 제시한다.

기존 연구들이 언어 모델의 **암기(Memorization)**와 **일반화(Generalization)**를 구분하는 데 어려움을 겪었던 점을 해결하기 위해, 두 개념을 공식적으로 분리하는 새로운 측정 방법을 제안한다.

연구에 따르면, 모델의 총 암기 용량은 **GPT 스타일 모델의 경우 파라미터당 약 3.6비트(bits per parameter)**인 것으로 나타났다. 연구진은 500K에서 1.5B 파라미터 규모의 수백 개의 Transformer 모델을 학습시키며 다음과 같은 현상을 관찰했다.

  • 용량 포화와 Grokking: 모델이 학습 데이터의 용량을 모두 채우면 '그로킹(Grokking)' 현상이 시작되며, 이때 의도치 않은 암기(Unintended memorization)는 감소하고 일반화가 시작된다.
  • 스케일링 법칙(Scaling Laws): 모델의 용량, 데이터 크기, 그리고 멤버십 추론(Membership Inference) 사이의 관계를 나타내는 일련의 스케일링 법칙을 도출했다.

이 연구는 모델이 데이터의 생성 프로세스를 학습하는 과정과 단순 암기하는 과정을 정량적으로 구분할 수 있는 프레임워크를 제공한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.