ParaRNN 공개, 비선형 RNN 훈련 200배 가속
ParaRNN: Parallel Training for Non-Linear RNNs (sLSTM, RWKV-7, CfC, Titans) via Triton Newton Scans [P]
·2026.09.07 19:31
핵심 내용
비선형 RNN의 병렬 훈련을 지원하는 오픈소스 라이브러리 ParaRNN이 공개되어 최대 200배 속도 향상을 달성했다.
자세히 보기
비선형 RNN의 순차적 병목을 해결하기 위해 Newton-Raphson 반복을 결합한 오픈소스 PyTorch/Triton 라이브러리 ParaRNN이 공개되었습니다. 이 도구는 sLSTM, RWKV-7, CfC, Titans 등 주요 비선형 아키텍처의 훈련 속도를 극적으로 개선합니다.
주요 성능 및 특징
- 훈련 속도 향상: 긴 시퀀스(T=2048)에서 CfC 모델 기준 순차적 BPTT 대비 약 200배의 벽시계 시간 단축을 달성했습니다 (RTX 3060 기준 643ms에서 2.79ms로 감소).
- 수렴 안정성: 131,072 토큰의 긴 컨텍스트에서도 Newton 반복 횟수가 3회 이하로 유지되며, 순차적 언롤과 동일한 수렴 특성을 보입니다.
- 지원 아키텍처: sLSTM, RWKV-7, CfC, Titans, Modern Hopfield, M²RNN 등을 위한 융합 커널을 제공합니다.
- 프로덕션 호환성:
torch.compile과의 완전한 호환성(그래프 브레이크 0건), 결정적 VJP 구현, 그리고 vLLM 플러그인을 지원합니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.