AI Briefing

talkie, 1930년대 언어모델 공개

Introducing talkie: a 13B vintage language model from 1930

·2026.04.28 11:47

핵심 내용

1931년 이전 영어로 학습한 13B 모델 talkie가 공개됐다.

자세히 보기

talkie는 1931년 이전 영어로만 학습한 13B language model이다. Hugging Face에 talkie-1930-13b-base(53.1GB)와 talkie-1930-13b-it(26.6GB)가 올라왔고, 베이스 모델은 260B 토큰의 역사적 텍스트로 학습됐다. 훈련 데이터는 미국 저작권 기준상 1931년 1월 1일 이전 자료라 전부 저작권 만료 상태다.

talkie-1930-13b-it는 에티켓, 서신 작성, 요리책, 사전, 백과사전, 시·우화집처럼 정형 구조가 있는 고전 참고자료에서 instruction-response 쌍을 뽑아 simple chat format으로 파인튜닝한 버전이다. 이후 instruction-following을 높이기 위해 생성 프롬프트 기반 rollout에 Claude Sonnet 4.6을 judge로 쓰는 online direct preference optimization(DPO) 를 적용했고, 마지막으로 Claude Opus 4.6과 talkie의 rejection-sampled 멀티턴 합성 대화로 한 번 더 SFT 했다.

저자는 이런 식으로 라이선스가 명확하거나 저작권이 만료된 데이터만 쓰는 모델을 vegan models라고 부른다. 베이스 모델은 이 기준에 가깝지만, 챗 모델은 현대 모델을 활용한 후속 학습 때문에 완전히 순수하다고 보기는 어렵다.

이 프로젝트가 던지는 핵심 질문은 다음과 같다.

  • 과거 사건 설명의 놀라움을 측정해 미래 예측 성능을 볼 수 있는가
  • 1911년까지만 아는 모델이 일반상대성이론 같은 아이디어를 스스로 떠올릴 수 있는가
  • HumanEval처럼 예시 몇 개만 보고 새 Python 프로그램을 쓸 수 있는가

저자들은 contamination과 현대 LLM이 주입하는 비시대적 지식을 경계한다. 장기적으로는 talkie 같은 빈티지 base model 자체를 judge로 써서, 현대 모델 의존 없이 시대에 맞는 post-training 파이프라인을 만들고자 한다.

데모에서 Generate an SVG of a pelican riding a bicycle를 넣자, 모델은 펠리컨이 자전거를 탄 SVG가 1860년에 만들어졌다고 답했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.