LittleLearner (웹사이트)
·2026.08.17 09:00
핵심 내용
LittleLearner는 특정 교육 과정 데이터로 학습된 모델을 통해, 사전 학습 데이터가 모델의 지식 습득 한계를 결정한다는 점을 입증했다.
자세히 보기
현대 언어 모델(LM)은 방대한 데이터를 동시에 학습하기 때문에, 특정 기술이 모델에 실제로 '학습(learned)'된 것인지 아니면 단순히 '인출(elicited)'된 것인지 구분하기 어렵다. LittleLearner는 이를 연구하기 위해 미국 초등학교(K-5) 교육 과정에 맞춰 필터링된 LittleCurriculum(88B 토큰)을 사용하여 통제된 샌드박스 환경을 구축했다.
LittleLearner는 0.6B, 1.3B, 5B의 세 가지 규모로 제공되며, 각 모델은 동일한 아키텍처와 레시피를 공유하는 Unfiltered 대조군과 함께 제공된다. 모델은 사전 학습된 Base, 수학 특화 GRPO, 일반 대화용 Chatty 변체로 구성된다.
실험 결과, 모델 규모 확장(Scaling), GRPO를 통한 사후 학습(Post-training), 인컨텍스트 학습(In-context learning)은 모두 교육 과정 범위 내(In-scope)의 성능은 향상시켰으나, 범위를 벗어난(Out-of-scope) 성능은 개선하지 못했다. 이는 사전 학습 단계의 데이터 필터가 모델의 실질적인 역량 한계(Capability ceiling)를 결정한다는 것을 입증한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.