연구진, LM 사전 학습 중 암기와 일반화 사이 급격한 전환 'mode-hopping' 발견
핵심 내용
OLMo3-32B는 산술 평가에서 2.17T~2.19T 토큰 구간 점수가 81%에서 0%로 급락했다.
자세히 보기
언어 모델이 사전 학습 중 패턴 매칭에서 일반화 지능으로 점진적으로 성숙한다는 통념은 오류다. 새로운 연구는 모델이 앵무새 같은 연산과 지능적인 연산 사이를 빈번하고 갑작스럽게 전환하는 현상을 발견했으며, 저자들은 이를 mode-hopping이라고 명명했다.
일반화의 불안정성
연구진은 장난감 평가 세트를 사용하여 OLMo3와 Apertus 모델의 사전 학습 체크포인트를 추적했다. 모델이 문맥 내 학습을 수행하는 대신 암기된 패턴이나 문맥 내 패턴에 갑작스럽게 집착하는 현상을 발견했다. 예를 들어, 'answer+1' 산술 프롬프트에서 OLMo3-32B는 2.17T 토큰에서 81% 점수를 기록했으나, 2.19T 토큰에서 **0%**로 급락했고, 2.21T 토큰에서 **81.7%**로 회복했다. 이러한 불안정성은 멀티홉 페르소나 QA, 문맥 외 추론, 진리와 유사 진리 구분 등 다양한 작업에서 나타난다.
최적화 노이즈 배제
연구는 mode-hopping이 단순한 최적화 변동이나 평가 지표의 아티팩트가 아니라고 주장한다. 이 현상은 하드 정확도와 소프트 확률 마진 모두에서 지속되며, 사전 학습 토큰과 FLOPs를 기준으로 플롯할 때도 나타난다. 또한, 배치 크기와 학습률을 변경한 단일 최적화 단계는 호핑을 유발하지 않았으며, 5개 체크포인트의 평균은 불안정성을 완화했지만 제거하지는 못했다.
체크포인트 선택을 위한 실용적 적용
저자들은 mode-hopping을 일반화 가능한 회로와 얕은 회로가 경쟁하는 용량 할당 문제로 볼 것을 제안한다. 이 통찰은 더 나은 체크포인트 선택을 가능하게 한다. 실험에서 4.5T 토큰 시점의 중간 OLMo3-32B 체크포인트는 수학 SFT 후 4.9T 토큰 시점의 후기 체크포인트보다 성능이 뛰어났다. GPQA 점수는 **36.3%**로 **29.8%**를 앞섰으며, 프리필링 공격에 대한 견고성도 **53%**로 **21%**보다 우수했다. 또한, 특정 사전 학습 데이터를 선택하면 이러한 일반화 동역학을 안정화하는 데 도움이 된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.