AI Briefing

2019-2025 사전학습 진보 분석: 데이터 개선이 모델 개선보다 3배 큰 기여

·2026.09.09 01:10

핵심 내용

2019~2025년 사전학습 진보에서 데이터 개선이 모델 개선보다 3.24배 큰 컴퓨팅 효율성 향상을 제공했다.

자세히 보기

2019년부터 2025년까지의 사전학습 진보를 분석한 결과, 데이터 개선이 모델 개선보다 3.24배 더 큰 컴퓨팅 효율성(Compute Efficiency Gain) 향상을 가져온 것으로 나타났다. 구체적으로 데이터 개선은 12.0배, 모델 개선은 3.7배의 효율성 증대를 보였다.

데이터와 모델의 독립적 효과

데이터와 모델 개선의 효과는 대부분 독립적이며 상호작용하지 않는 것으로 분석됐다. OLMES 벤치마크 점수 분산의 88%가 모델과 데이터 개선의 가산 효과로 설명 가능했다. 이는 두 요소가 서로 복잡하게 얽히기보다 각각의 기여도가 명확함을 의미한다.

모델 개선의 본질적 가치

모델 아키텍처 개선의 핵심 가치는 단순한 FLOPs 효율성이 아니라, 대규모 컴퓨팅을 가능하게 하는 제약 제거에 있다. MoE, FlashAttention, 안정성 혁신(Norm, Initialization) 등이 대형 모델 학습을 가능하게 했다. 반면, 대형 모델은 과잉 용량으로 인해 저품질 데이터를 포함해도 SGD가 노이즈를 걸러내는 특성을 보인다.

대형 모델과 데이터 큐레이션의 역설

대형 모델에서는 과도한 데이터 큐레이션(aggressive data curation)이 오히려 성능을 저하시킬 수 있다. 필터링된 데이터셋은 수십 epoch 학습이 필요하지만, 이는 낮은 평균 품질의 대형 데이터셋보다 성능이 떨어진다. Frontier 모델들은 추론 컴퓨팅 최소화를 위해 Chinchilla optimal 대비 최대 100배 overtrained되는 경향이 있다.

연평균 효율성 증가율(CEG)

2019~2025년 연평균 컴퓨팅 효율성 증가율은 모델 1.24배, 데이터 1.51배, 합산 1.57배로 집계됐다. 이는 Anson Ho et al.의 3배 추정치보다 낮은 수치다. 이러한 차이는 Scale 의존적 개선 미실현, Inference 최적화 미포함, 그리고 OLMES 벤치마크의 특성(쉬운 10개 태스크) 등에 기인한 것으로 분석된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.