AI Briefing

Ring-Zero: 1조 개 파라미터로 스케일링한 제로 RL을 통한 창발적 추론

·2026.07.17 06:38

1조 파라미터 규모의 LLM을 제로 RL로 학습해 자동 검증, 구조화된 포맷, 자체 검증 등 고급 추론 능력이 창발되었다.

제로 RL의 1조 파라미터 규모 확장

이 논문은 인간이 주석을 달지 않은 검증 가능한 보상을 사용하는 제로 강화학습(Zero RL)을 1조 파라미터 규모의 대규모 언어모델에 적용한 첫 사례를 보고한다. 기존 연구는 계산 제약으로 인해 소형 모델에 제한되어 있었으나, 이번 연구는 대규모에서의 학습 동역학과 창발 능력을 탐구했다.

주요 기술 개선

순진한 스케일링은 낮은 가독성, 토큰 중복, 적응형 추론 깊이 부족 문제를 겪었다. 연구팀은 다음을 포함한 안정적이고 효율적인 학습 파이프라인을 제시했다:

  • 잘린 중요도 샘플링
  • 학습-추론 비율 보정
  • 혼합 정밀도 제어

핵심 발견 사항

  1. 스케일의 이득: 1조 파라미터로 확장하면 샘플 효율성과 성능 상한이 크게 향상됨
  2. 학습 단계: 초기 발견 단계 → 정제 단계로 순차적으로 진행
  3. 자동 창발 능력: 수작업 휴리스틱 없이도 의인화, 구조화된 포맷, 자체 검증, 병렬 추론, 맥락 불안감 등 고급 인지 행동이 자동으로 발생

평가 결과

7개 수학 벤치마크에서 Ring-2.5-1T-Zero가 경쟁력 있는 성능 달성. 최종 정답 정확성 외에도 체인오브쏘트(CoT) 품질을 이해도, 재현성, 효율성 3개 차원에서 평가하는 구조화된 평가 프레임워크를 제안했으며, 모델이 구조화되고 간결한 추론 기록 생성에서 명확한 우위를 보임.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.