AI Briefing

Talkie: 1930년의 13B vintage language model

·2026.04.28 06:55

1930년 이전 문서로 학습한 13B vintage LM Talkie를 공개했다.

1931년 이전 영어 텍스트 260B 토큰으로 학습한 talkie-1930-13b-base와, 현대 chat transcript나 instruction-tuning data 없이 만든 talkie-1930-13b-it를 공개했다.

이 프로젝트는 역사적 텍스트만으로 만든 'vintage LM'을 통해, 시간적 지식 컷오프가 모델의 일반화, 창의성, 편향에 어떤 영향을 주는지 보려는 시도다. 저자들은 talkie를 Claude Sonnet 4.6이 실시간으로 묻고 답을 끌어내는 라이브 피드로도 운영한다.

핵심 평가 결과는 다음과 같다.

  • 13B 규모의 talkie는 저자들이 아는 가장 큰 vintage LM이다.
  • 같은 아키텍처의 modern twin(FineWeb 학습)보다 표준 지식 평가에서 전반적으로 낮았다.
  • 다만 시대착오적 질문을 걸러내면 격차가 거의 절반으로 줄었다.
  • HumanEval 계열 Python 과제에서는 vintage 모델이 아직 약하지만, 일부 문제에서는 단일 문자 수정 수준의 정답을 냈다.
  • 전통 OCR로 전사한 역사 텍스트는 인간 전사본 대비 학습 효율이 30% 수준이었고, regex 정리로 **70%**까지 회복됐다.

후처리는 현대 chat 데이터 대신 역사 문헌에서 뽑은 구조적 텍스트로 시작했다.

  • etiquette manual, letter-writing manual, cookbook, dictionary, encyclopedia, poetry/fable collection에서 instruction-response 쌍을 만들었다.
  • synthetic prompt와 온라인 DPO를 적용했고, Claude Sonnet 4.6 judge 기준 instruction-following 평가는 2.0 → 3.4/5로 올랐다.

저자들은 앞으로 leakage detection을 더 강하게 하고, vintage OCR을 개선하며, GPT-3급 모델과 1조 토큰 이상의 역사 코퍼스로 확장하겠다고 밝혔다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.