AI Briefing

1930년대 지식 LLM 공개

Anyone tried this yet? LLM with knowledge date in the 1930s

·2026.04.28 10:17

핵심 내용

pre-1931 텍스트로 학습한 13B vintage LLM talkie의 성능과 한계를 공개했다.

1 / 2

자세히 보기

talkie-1930-13b는 1931년 이전 영어 텍스트 260억이 아닌 2600억 토큰 규모의 코퍼스로 학습한 13B vintage LLM이다. 같은 아키텍처의 modern twin(FineWeb 학습)과 비교해 지식 평가에서는 뒤처지지만, 1930년 시점에서 비동시대적인 질문을 제외하면 성능 격차가 절반가량 줄었다.

  • contamination-free 실험용 모델로서, 과거 시점 일반화와 예측 능력을 측정하는 데 활용했다.
  • HumanEval 스타일 Python 과제에서는 현대 모델보다 훨씬 약했지만, 단순 1줄 프로그램과 작은 수정형 문제는 점점 더 잘 풀었다.
  • Roosevelt 대통령과 New Deal처럼 후대 지식이 일부 새어 들어간 사례도 확인돼, temporal leakage 필터링이 핵심 과제로 제시됐다.

데이터 품질도 큰 병목이었다. 기존 OCR로 전사한 역사 텍스트는 인간 전사본 대비 학습 효율이 30% 수준이었고, regex 정리 후에도 70% 수준에 그쳤다. 이를 개선하기 위해 vintage OCR 시스템을 개발 중이다.

후처리는 현대 chat 데이터 대신 역사 문헌의 정형 문답, 요약, 대화 데이터를 재구성해 만들었다. 여기에 synthetic prompt와 Claude Sonnet 4.6 판정 기반 DPO를 더해 instruction-following 점수를 2.0에서 3.4/5까지 올렸다.

팀은 앞으로 GPT-3급 모델과 1조 토큰 이상의 역사 코퍼스 확장을 목표로 하고 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.