AI Briefing

Unbounded Labs, 빈티지 LLM Bart 공개

Bart: A vintage llm

·2026.08.25 01:14

핵심 내용

Unbounded Labs가 1931년 이전 데이터로 학습한 2.82B 파라미터 LLM 'Bart'를 공개했다.

자세히 보기

Unbounded Labs는 1931년 이전 영어 텍스트 20.1B 토큰으로 학습한 2.82B 파라미터 규모의 LLM 'Bart'를 출시했다. 이 모델은 과거 과학자들의 사고 과정을 재현할 수 있는지 탐구하기 위해 개발되었으며, 총 807달러의 비용으로 자체적으로 구축되었다.

주요 성과 및 오픈소스

  • 데이터셋: 하버드 Institutional Books(242B 토큰)를 정제해 23B 토큰의 고품질 코퍼스를 구축했다.
  • 벤치마크: 기존에 없던 빈티지 LLM 전용 평가 스위트 Vintage CORE를 제작했다.
  • 성능: 동일 규모 모델 중 Vintage CORE 벤치마크에서 GPT-1900보다 우수한 성능을 보였다.
  • 데이터 공개: 1930년대 이전 텍스트에 기반한 416k 개의 SFT 데이터셋을 공개했다.
  • 트레이닝: H100 GPU에서 5일 만에 최종 모델을 학습했으며, **60%**의 MFU를 유지했다.

모든 데이터셋, 방법론, 학습 코드 및 평가 결과는 오픈소스로 공개되어 연구자들이 직접 검증하고 활용할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.