초기 LLM 학습 결과 재현 요청
The loss curve said tie. The judges said otherwise. Seeking replication for an early LLM training result [R]
·2026.04.28 23:43
핵심 내용
새 학습 신호를 넣은 1.2B LLM이 블라인드 평가에서 59.9% 선호를 얻었다.
자세히 보기
새로운 loss shaping 기법 두 가지를 적용한 1.2B 파라미터 LLM이 블라인드 선호 평가에서 우위를 보였다.
- per-token gain은 각 토큰 loss를 surprisal에 따라 가중하되, 평균 gradient budget은 유지했다.
- per-layer divergence scaling은 각 transformer block이 forward pass에서 표현을 얼마나 바꿨는지에 따라 gradient를 조절했고, 전체 스케일은 정규화했다.
- 비교군은 standard cross-entropy였고, 두 모델은 동일 데이터·동일 순서·동일 seed로 30,000 steps, 3.9B tokens까지 학습했다.
smoothed validation loss는 두 모델 간 통계적으로 같았다. 그러나 42명의 블라인드 평가자(인간 29명, foundation-model judges 13명)가 남긴 1,181건의 pairwise judgment에서는 gain-trained model이 decisive comparison 784건 중 **59.9%**를 얻었고, tie는 **33.6%**였다.
인간과 foundation-model judges의 decisive 선호율은 각각 **60.5%**와 **59.0%**로 거의 같았다. 32개 질문 중 26개에서 인간 다수결과 FM 다수결이 같은 방향이었고, 질문별 gain rate 상관은 Pearson r = 0.78이었다. per-judgment independence 가정하에 two-sided binomial p = 2.80e-8를 제시했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.