AI Briefing

파라미터 반토막

Doing more with fewer parameters using stable looped models

·2026.04.17 12:42

핵심 내용

Parcae는 반복 루프 구조로 770M이 1.3B Transformer급 성능을 노린다.

자세히 보기

Parcae는 looped language model의 안정성 문제를 정면으로 해결한 새로운 아키텍처다.

핵심은 반복 구조의 residual dynamics를 안정적인 LTI 시스템으로 해석하고, 입력 주입을 연속 파라미터화 + ZOH/Euler discretization으로 바꾸는 것. A를 음의 대각행렬로 제약해 spectral radius를 1보다 작게 유지하도록 설계해, 기존 looped model에서 자주 보이던 residual state explosion과 loss spike를 크게 줄였다.

실험 결과도 구체적이다.

  • 기존 대형 looped recipe 대비 validation perplexity 최대 6.3% 개선
  • 770M Parcae가 같은 데이터로 학습한 1.3B Transformer와 비슷한 품질을 달성
  • 140M / 370M / 770M / 1.3B 규모 전반에서 parameter- and data-matched Transformer보다 더 좋은 perplexity와 downstream 점수를 기록

스케일링 관점에서도 중요한 결론을 제시한다.

  • compute budget이 고정되면, recurrence를 늘리고 데이터를 함께 조정하는 쪽이 더 낫다
  • 최적 recurrence와 token budget이 각각 power law를 따른다
  • 이로 인해 looped Parcae는 fixed-depth 모델보다 더 촘촘한 Pareto frontier를 만든다

결론적으로, 이 작업은 on-device나 메모리 제약 환경에서 파라미터를 늘리지 않고 품질을 끌어올리는 경로를 제시하며, 코드와 모델도 공개했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.