WarpState, 이중 메모리 기반 장문 LLM 아키텍처 공개
WarpState: experimenting with dual-timescale associative memory + local attention for long-running LLMs
·2026.09.21 23:57
핵심 내용
토큰 수와 무관한 고정 크기의 이중 연상 메모리를 활용해 장문 컨텍스트를 처리하는 LLM 아키텍처 WarpState가 공개됐다.
자세히 보기
장기 실행 LLM을 위해 토큰 단위 KV 캐시 대신 컴팩트한 재귀적 메모리를 유지하는 실험적 아키텍처 WarpState가 공개됐다. 이 모델은 128-토큰 청크 내 정확한 인과적 self-attention과 함께, 서로 다른 감쇠율(decay rate)을 가진 두 개의 연상 매트릭스 메모리(Fast/Slow)를 결합한다.
핵심 아키텍처 및 메모리 구조
- 이중 메모리 시스템: Fast 메모리(β≈0.90)와 Slow 메모리(β≈0.99)를 통해 단기 및 장기 정보를 분리 저장한다. 입력 의존적 게이트가 로컬 어텐션과 재귀 메모리 사용 비율을 동적으로 결정한다.
- 고정 크기 상태: 재귀적 상태가 처리된 토큰 수에 따라 증가하지 않아, 2B 파라미터 모델 기준 약 49 MiB의 영구 텐서 캐시만 사용한다.
- 안정성 보장: 바운디드 쓰기(bounded writes)와 볼록 결합 업데이트를 통해 메모리 값이 [-1, 1] 범위로 제한되어 수치적 안정성을 확보한다.
성능 및 한계
- 참고 규모: 약 2.005B 파라미터, 28개 논리적 레이어, 128-토큰 청크 크기를 가진 프리셋이 제공된다.
- 구현 주의사항: 병렬 forward/training 구현은 청크 수에 대해 quadratic 복잡도를 가지므로, 현재로서는 임의의 긴 시퀀스에서 linear-time이 아니다. 향후 optimized scan/tiled recurrence 적용이 필요하다.
- 검증 현황: FP32 환경에서 serial/parallel 경로 간 최대 절대 오차가 1.79e-7 이내로 인과적 순서가 확인되었으나, BF16 환경에서는 정밀도 차이로 인한 불일치가 발생한다. 과거 150M 파라미터 모델의 검증 데이터는 독립적 재현이 불가능한 역사적 보고서로 취급해야 한다.
향후 계획
연구팀은 로컬 어텐션 단독, 단일 메모리, WarpState 이중 메모리 모델을 동일한 조건에서 비교하는 통제된 실험을 계획 중이다. 이를 통해 고정 크기 재귀 상태가 바이트와 FLOP당 얼마나 유용한 정보를 보존하는지 평가할 예정이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.