AI Briefing

ParaRNN: 병렬로 학습 가능한 대규모 비선형 RNN

·2026.04.23 09:00

Apple의 ParaRNN이 LLM용 비선형 RNN 학습을 병렬화해 665× 빨라졌다.

Apple 연구진이 ParaRNN을 제시했다. 대규모 언어 모델(LLM)을 위한 비선형 RNN 학습을 병렬화하는 프레임워크로, 전통적인 순차 학습 방식보다 665× 빠른 속도를 보였고, 처음으로 7B 파라미터급 전통적인 RNN이 transformerMamba2에 견줄 언어 모델링 성능을 보였다. 논문은 ICLR 2026 Oral로 채택됐고, 코드도 오픈소스로 공개됐다.

RNN은 추론 단계에서 여전히 강점이 있다. attention 기반 모델처럼 긴 컨텍스트 전체를 저장하고 다시 참조할 필요가 적어 토큰 생성이 **O(1)**에 가깝고, 메모리와 연산 부담도 작다. 문제는 훈련에서는 시퀀스 길이 방향 병렬화가 되지 않아 대규모 확장이 어렵다는 점이다.

기존의 병렬 가능한 순환 모델은 recurrence를 선형으로 제한해 왔다. Mamba 같은 selective state space model(SSM)은 h_l = A_l h_{l-1} + B_l x_l 형태라 parallel scan으로 계산할 수 있지만, 그만큼 표현력이 줄어든다.

ParaRNN은 이 한계를 Newton's method로 우회한다. 전체 hidden state를 하나의 비선형 방정식 시스템으로 보고, 각 반복에서 Jacobian으로 선형화한 뒤 SSM 형태의 문제로 바꿔 병렬로 푼다. 연구진은 이를 ParaGRUParaLSTM으로 구현해 Jacobian을 각각 diagonal, block-diagonal로 만들었고, custom CUDA kernels로 효율을 끌어올렸다.

  • 핵심 비선형성은 유지하고 학습만 병렬화
  • 실험에서는 대체로 3회 Newton 반복이면 수렴
  • 구조화된 Jacobian과 GPU 최적화로 대규모 학습을 가능하게 했다

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.