AI Briefing

LLM 사전 학습에서 도메인 데이터 반복 스케일링

·2026.08.18 09:00

핵심 내용

LLM 스케일링 시 도메인 데이터 반복 횟수가 모델 크기에 따라 증가하는 경향을 확인했다.

자세히 보기

LLM이 스케일링되면 적절한 토큰 대 파라미터 비율(TPP)을 유지하기 위해 학습 토큰 예산이 증가해야 합니다. 그러나 고품질 도메인 데이터는 일반 웹 데이터보다 확장성이 낮아, 모델 규모가 커질수록 학습 믹스에서의 비중이 감소하는 희석 현상이 발생합니다.

이 희석을 상쇄하기 위해 기존 고품질 데이터를 반복하는 것이 효과적이지만, 과도한 반복은 과적합을 유발할 수 있습니다. 연구팀은 실제 LLM 스케일링 환경에서 이 트레이드오프를 분석했습니다.

주요 발견 사항은 다음과 같습니다.

  • 모델 크기와 반복 횟수: 고정된 TPP 조건에서 최적의 반복 횟수는 모델 크기가 커질수록 약간 증가합니다.
  • 도메인별 상관관계: 최적 반복 횟수는 해당 도메인의 최종 검증 손실(validation loss)과 강한 음의 상관관계를 보입니다. 손실이 낮은 도메인일수록 더 많은 반복이 유리합니다.
  • 데이터 양과의 관계: 고유 도메인 데이터의 양은 최적 반복 횟수와 약한 관계만 보입니다.

이러한 결과들은 동일한 TPP를 가진 작은 프록시 모델에서 튜닝한 반복 횟수가 더 큰 모델에 대한 실용적인 추정치로 사용될 수 있음을 시사합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.