AI Briefing

데이터 제약 하의 믹스 사전학습 스케일링 법칙

·2026.08.20 09:00

핵심 내용

희소 데이터는 15~20회 재사용이 최적이며, 이를 반영한 스케일링 법칙을 제시했다.

자세히 보기

언어 모델이 확장될수록 필요한 데이터량은 증가하지만, 저자원 언어나 전문 도메인 등 일부 데이터 소스는 본질적으로 크기가 제한적입니다. 이러한 희소 데이터를 풍부한 일반 데이터와 혼합하는 전략은 타겟 도메인 노출 부족과 과도한 반복으로 인한 과적합 사이의 근본적인 트레이드오프를 내포합니다.

Apple 연구진은 2,000회 이상의 언어 모델 학습 실험을 통해 이 트레이드오프를 분석했습니다. 연구 결과, **반복(repetition)**이 타겟 도메인 성능의 핵심 동인임이 밝혀졌으며, 단일 소스 학습보다 믹스 학습이 훨씬 높은 반복률을 허용한다는 점이 확인되었습니다. 희소 타겟 코퍼스도 15~20회까지 재사용할 수 있으며, 최적 반복 횟수는 타겟 데이터 크기, 컴퓨트 예산, 모델 규모에 따라 달라집니다.

연구진은 반복을 인지한 **믹스 스케일링 법칙(repetition-aware mixture scaling law)**을 도입했습니다. 이 법칙은 반복된 타겟 토큰의 가치 감소와 일반 데이터의 정규화 역할을 고려하여, 데이터 제약 하의 사전학습에 대한 실질적인 믹스 구성을 계산하는 원칙적인 방법을 제공합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.