AI Briefing

1930년대 지식 LLM 공개

Anyone tried this yet? LLM with knowledge date in the 1930s

·2026.04.28 10:17

pre-1931 텍스트로 학습한 13B vintage LLM talkie의 성능과 한계를 공개했다.

talkie-1930-13b1931년 이전 영어 텍스트 260억이 아닌 2600억 토큰 규모의 코퍼스로 학습한 13B vintage LLM이다. 같은 아키텍처의 modern twin(FineWeb 학습)과 비교해 지식 평가에서는 뒤처지지만, 1930년 시점에서 비동시대적인 질문을 제외하면 성능 격차가 절반가량 줄었다.

  • contamination-free 실험용 모델로서, 과거 시점 일반화와 예측 능력을 측정하는 데 활용했다.
  • HumanEval 스타일 Python 과제에서는 현대 모델보다 훨씬 약했지만, 단순 1줄 프로그램과 작은 수정형 문제는 점점 더 잘 풀었다.
  • Roosevelt 대통령과 New Deal처럼 후대 지식이 일부 새어 들어간 사례도 확인돼, temporal leakage 필터링이 핵심 과제로 제시됐다.

데이터 품질도 큰 병목이었다. 기존 OCR로 전사한 역사 텍스트는 인간 전사본 대비 학습 효율이 30% 수준이었고, regex 정리 후에도 70% 수준에 그쳤다. 이를 개선하기 위해 vintage OCR 시스템을 개발 중이다.

후처리는 현대 chat 데이터 대신 역사 문헌의 정형 문답, 요약, 대화 데이터를 재구성해 만들었다. 여기에 synthetic prompt와 Claude Sonnet 4.6 판정 기반 DPO를 더해 instruction-following 점수를 2.0에서 3.4/5까지 올렸다.

팀은 앞으로 GPT-3급 모델1조 토큰 이상의 역사 코퍼스 확장을 목표로 하고 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.