AI Briefing

적게 담아 더 많이 채우기: 학습 데이터 프루닝을 통한 사실 정보 암기력 향상

·2026.04.14 09:00

핵심 내용

학습 데이터 프루닝을 통해 데이터 분포를 최적화함으로써 LLM의 사실 정보 암기 성능을 대폭 향상시킬 수 있다.

자세히 보기

LLM은 파라미터 내에 사실적 지식을 암기하는 데 어려움을 겪으며, 이는 종종 할루시네이션과 성능 저하로 이어진다. 연구에 따르면, 학습 데이터의 정보량이 모델의 **수용량(Capacity)**을 초과하거나 사실의 빈도 분포가 **멱법칙(Power law)**을 따르며 불균형할 때 사실 정확도가 저하된다.

이를 해결하기 위해 **학습 손실(Training Loss)**만을 활용하여 데이터의 양을 제한하고 빈도 분포를 평탄하게 만드는 데이터 선택(Data Selection) 기법을 제안한다.

실험 결과, 이 방법론은 다음과 같은 성과를 거두었다:

  • 고엔트로피 사실을 포함한 데이터셋에서 사실 정확도를 모델의 수용량 한계치까지 끌어올렸다.
  • Wikipedia 코퍼스로 학습 시, GPT2-Small(110M) 모델이 기존 방식보다 1.3배 더 많은 개체 사실을 암기했다.
  • 이는 전체 데이터로 학습한 1.3B 규모의 모델과 대등한 성능을 달성한 결과다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.