AI Briefing

대규모 언어 모델 학습에서 다운스트림 지표의 스케일링 특성 재검토

·2026.03.26 09:00

핵심 내용

토큰·파라미터 비율이 고정되면 다운스트림 정확도도 파워 법칙으로 예측된다.

자세히 보기

LLM 스케일링은 그동안 주로 pretraining loss 같은 대리 지표에 맞춰져 있었고, downstream task 성능 예측은 불안정하다고 여겨졌다. 이 연구는 학습 예산에서 바로 benchmark 성능을 모델링하는 직접 프레임워크를 제안하며, 고정된 token-to-parameter ratio에서는 여러 downstream task의 log accuracy가 단순한 power law로 잘 설명된다고 보여준다.

직접 접근 방식은 기존의 two-stage procedure보다 외삽 성능이 더 좋았다. 기존 방식은 중간 예측 오차가 누적되기 쉬운데, 이번 방식은 학습 규모에서 바로 성능을 추정해 그런 문제를 줄인다.

또한 저자들은 token-to-parameter ratio 전반의 정확도를 예측하는 함수 형태와, 반복 샘플링을 통한 inference compute까지 반영하는 식을 제시했다. 실험은 최대 17B parameters, 최대 350B tokens, 그리고 두 가지 dataset mixture에서 검증됐다.

재현성을 위해 pretraining loss와 downstream evaluation 결과 전체도 공개했다. 이 논문은 ICLR의 Workshop on Memory for LLM-Based Agentic Systems에 채택됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.