대규모 언어 모델 학습에서 다운스트림 지표의 스케일링 특성 재검토
핵심 내용
토큰·파라미터 비율이 고정되면 다운스트림 정확도도 파워 법칙으로 예측된다.
자세히 보기
LLM 스케일링은 그동안 주로 pretraining loss 같은 대리 지표에 맞춰져 있었고, downstream task 성능 예측은 불안정하다고 여겨졌다. 이 연구는 학습 예산에서 바로 benchmark 성능을 모델링하는 직접 프레임워크를 제안하며, 고정된 token-to-parameter ratio에서는 여러 downstream task의 log accuracy가 단순한 power law로 잘 설명된다고 보여준다.
직접 접근 방식은 기존의 two-stage procedure보다 외삽 성능이 더 좋았다. 기존 방식은 중간 예측 오차가 누적되기 쉬운데, 이번 방식은 학습 규모에서 바로 성능을 추정해 그런 문제를 줄인다.
또한 저자들은 token-to-parameter ratio 전반의 정확도를 예측하는 함수 형태와, 반복 샘플링을 통한 inference compute까지 반영하는 식을 제시했다. 실험은 최대 17B parameters, 최대 350B tokens, 그리고 두 가지 dataset mixture에서 검증됐다.
재현성을 위해 pretraining loss와 downstream evaluation 결과 전체도 공개했다. 이 논문은 ICLR의 Workshop on Memory for LLM-Based Agentic Systems에 채택됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.