AI Briefing

ParaRNN 공개, 비선형 RNN 훈련 200배 가속

ParaRNN: Parallel Training for Non-Linear RNNs (sLSTM, RWKV-7, CfC, Titans) via Triton Newton Scans [P]

·2026.09.07 19:31

핵심 내용

비선형 RNN의 병렬 훈련을 지원하는 오픈소스 라이브러리 ParaRNN이 공개되어 최대 200배 속도 향상을 달성했다.

자세히 보기

비선형 RNN의 순차적 병목을 해결하기 위해 Newton-Raphson 반복을 결합한 오픈소스 PyTorch/Triton 라이브러리 ParaRNN이 공개되었습니다. 이 도구는 sLSTM, RWKV-7, CfC, Titans 등 주요 비선형 아키텍처의 훈련 속도를 극적으로 개선합니다.

주요 성능 및 특징

  • 훈련 속도 향상: 긴 시퀀스(T=2048)에서 CfC 모델 기준 순차적 BPTT 대비 약 200배의 벽시계 시간 단축을 달성했습니다 (RTX 3060 기준 643ms에서 2.79ms로 감소).
  • 수렴 안정성: 131,072 토큰의 긴 컨텍스트에서도 Newton 반복 횟수가 3회 이하로 유지되며, 순차적 언롤과 동일한 수렴 특성을 보입니다.
  • 지원 아키텍처: sLSTM, RWKV-7, CfC, Titans, Modern Hopfield, M²RNN 등을 위한 융합 커널을 제공합니다.
  • 프로덕션 호환성: torch.compile과의 완전한 호환성(그래프 브레이크 0건), 결정적 VJP 구현, 그리고 vLLM 플러그인을 지원합니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.