AI Briefing

Claude/GPT의 지식 cutoff와 pre-training 타임라인 분석

·2026.08.11 09:00

핵심 내용

모델을 정교하게 probing해 지식 cutoff와 pre-training 시점을 추정한다.

자세히 보기

프론티어 모델에 정교한 질문을 던지고 답변을 분석하면, 공개되지 않은 학습 과정과 데이터 구성을 추정할 수 있다. 연구자는 이를 통해 모델의 파라미터 규모, 학습 데이터 혼합, pre-training 시점 등을 간접적으로 파악한다.

주요 방법은 다음과 같다.

  • Incompressible Knowledge Probes: 틈새 지식 문제의 정답률을 평가해 GPT-5나 Opus 같은 모델의 파라미터 규모를 추정한다.
  • Data Mixture Inference: 토큰 분할 방식을 분석해 학습 데이터의 구성이나 tokenizer에 사용된 데이터 혼합을 추론한다.
  • 날짜 및 자기 식별 관련 질문: 모델이 어느 시점까지의 정보를 학습했는지 측정해 training timeline을 추정한다.

대규모 LLM 학습은 일반적으로 세 단계로 진행된다. 먼저 인터넷 등 방대한 범용 데이터를 사용해 base model을 pre-training하고, 이후 교과서 수준의 전문 데이터로 장문 이해와 특정 역량을 강화한다. 마지막으로 post-training을 통해 모델을 assistant persona로 전환하고, 성격·추론 능력·tool calling을 다듬는다.

가장 비용과 데이터가 많이 필요한 단계는 수개월에 걸쳐 base checkpoint를 만드는 pre-training이다. 이 과정에서 capability 및 post-training 팀은 최신 checkpoint를 개선하는 실험을 진행하고, 결과에 따라 GPT-4에서 GPT-5로 이어지는 major version이나 Fable·Opus·Sonnet·Haiku 같은 모델군이 만들어질 수 있다.

실제 공개 모델은 가장 최근 checkpoint에 최적의 capability와 post-training을 조합한 결과물이다. 다만 공개된 검증 자료가 제한적이므로, 이러한 분석 결과는 모두 추정치이며 일부 해석은 실제 학습 과정과 다를 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.