AI Briefing

Unbounded Labs, 빈티지 LLM 'Bart' 공개

Bart- A vintage llm [R]

·2026.08.25 02:20

핵심 내용

Unbounded Labs가 1931년 이전 텍스트로 학습한 2.82B 파라미터 LLM 'Bart'를 오픈소스로 공개했다.

자세히 보기

Unbounded Labs는 1931년 이전의 영어 텍스트 20.1B 토큰으로 학습한 2.82B 파라미터 규모의 LLM 'Bart'를 공개했습니다. 이 모델은 Demis Hassabis의 제안에 착안해, 과거 과학자들이 도달했던 결론을 LLM이 재현할 수 있는지 탐구하기 위해 개발되었습니다.

주요 성과 및 공개 자료는 다음과 같습니다.

  • 데이터셋: 하버드 Institutional Books(242B 토큰)를 정제하여 23B 토큰의 고품질 코퍼스 생성.
  • 벤치마크: 기존에 없던 빈티지 LLM 전용 평가 스위트 Vintage CORE(20개 벤치마크)를 최초 개발.
  • 모델 성능: 해당 스케일에서 GPT-1900보다 적은 토큰 예산으로 더 높은 성능을 기록.
  • 오픈소스: 41.6만 개의 Q&A로 구성된 SFT 데이터셋, 학습 코드, 평가 지표, 학습 로그 등 전체 자산을 공개.

모델은 H100 GPU에서 5일간의 학습으로 완성되었으며, 모든 연구 과정과 실수까지 상세히 기록한 블로그 글과 함께 Hugging Face에서 접근 가능합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.