AI Briefing

안정적인 looped model로 더 적은 파라미터로 더 높은 성능을 내는 Parcae

·2026.04.16 09:00

핵심 내용

Parcae는 recurrence를 키워 770M로 1.3B Transformer급 성능을 냈다.

자세히 보기

Parcae는 looped language model을 안정적으로 학습시키기 위한 아키텍처로, 같은 규모의 Transformer보다 더 적은 파라미터로 비슷하거나 더 나은 품질을 목표로 한다. 특히 770M Parcae가 같은 데이터로 학습한 1.3B Transformer 수준의 성능에 근접해, 파라미터 효율의 새 가능성을 보여줬다.

기존 looped model은 반복 구조 때문에 residual state explosion과 loss spike가 발생해 학습이 불안정했다. Parcae는 이를 선형 동역학 시스템 관점에서 분석해, 반복 블록의 안정성을 좌우하는 spectral radius를 1 미만으로 유지하도록 설계했다.

구조는 Transformer를 prelude( $\mathcal{P}$), recurrent( $\mathcal{R}$), **coda( $\mathcal{C}$)**로 나눈다.

  • prelude가 입력을 latent state로 바꾸고
  • recurrent 블록이 같은 층을 여러 번 재사용하며 상태를 갱신하고
  • coda가 최종 출력을 만든다.

안정성을 위해 입력 주입 파라미터를 연속형 표현 A, B로 두고, 이를 ZOH와 Euler 방식으로 이산화한다. 또한 A = Diag(-exp(log_A)) 형태의 음수 대각 행렬로 제약해, 반복이 발산하지 않도록 만든다.

실험에서는 Parcae가 기존 대규모 looped recipe보다 validation perplexity를 최대 6.3% 낮췄다. 또한 RDM을 그대로 가져와도 Parcae 제약을 넣으면 학습이 안정화됐고, 추가 트릭까지 적용하면 성능이 더 개선됐다.

스케일링 측면에서도 중요한 결과를 냈다. 저자들은 looping과 데이터 증가를 함께 늘려야 compute-optimal하다는 첫 scaling law를 제시했고, 평균 recurrence와 토큰 예산이 모두 power law를 따른다고 관찰했다. 이 결과는 고정 깊이 모델보다 더 엄격한 Pareto frontier를 만들어, 같은 자원에서 더 좋은 품질을 얻을 수 있음을 보여준다.

마지막으로 저자들은 training code와 models를 공개해, 온디바이스나 메모리 제약이 큰 환경에서 parameter reuse 기반 모델을 더 탐색할 수 있는 발판을 마련했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.