Matrix Orthogonalization Improves Memory in Recurrent Models
·2026.07.01 14:13
핵심 내용
mLSTM의 메모리 행렬에 직교화(Orthogonalization)를 적용하여 순환 모델의 노이즈 섞인 연상 기억 능력을 개선했다.
1 / 2
자세히 보기
Transformer의 강력한 연상 기억(Associative Recall, AR) 능력을 따라잡기 위해 mLSTM과 같은 순환 신경망(RNN)의 성능을 높이는 연구가 진행되었습니다. 기존 mLSTM은 특정 벤치마크에서 우수한 성능을 보였으나, 노이즈가 포함된 환경에서의 성능(NAR) 측정에는 한계가 있었습니다.
본 연구는 최적화 도구인 Muon의 아이디어를 차용하여, mLSTM의 메모리 행렬을 읽기(Read) 단계에서 **직교화(Orthogonalization)**하는 방식을 제안합니다. 이는 특정 방향의 업데이트가 지배하는 것을 방지하고 약한 메모리 정보가 소실되지 않도록 돕습니다.
실험 결과, 직교화된 mLSTM은 MAD의 Noisy AR 태스크에서 기존 mLSTM 대비 압도적인 성능 향상을 보였습니다:
- Vocab 80, Len 512: 정확도 87.5% (Baseline 대비 +18.4%p)
- Vocab 96, Len 1024: 정확도 68.5% (Baseline 대비 +45.4%p)
연구팀은 직교화된 메모리를 다시 쓰지 않고 Readout 단계에서만 사용할 때 성능이 가장 높다는 점을 발견했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.