FactorEngram 논문, LLM용 분해된 n-gram 메모리 소개
[Paper] FactorEngram: Factorized N-gram Memory with Basis-Level Gating for Language Models
핵심 내용
FactorEngram은 기저 수준 게이팅으로 340M 및 1B 백본의 언어 모델 성능을 개선했다.
자세히 보기
FactorEngram은 기존 Engram 등 조회 기반 메모리 시스템의 한계를 해결하기 위해 **기저 수준 문맥 게이팅(basis-level contextual gating)**을 적용한 **분해된 n-gram 메모리(factorized n-gram memory)**를 도입했다. 기존 설계는 검색된 임베딩을 단일 스칼라 게이트로 변조되는 단위로 취급해 다의적 패턴이 관련 메모리 구성 요소에 선택적으로 접근하지 못하고, 무관한 해시 충돌에만 파라미터 공유가 제한되는 문제가 있었다.
작동 방식
FactorEngram은 패턴 간에 공유되는 기저 벡터 사전에 대해 **희소성 정규화 계수(sparsity-regularized coefficients)**를 검색하여 관련 패턴이 공통 구성 요소를 재사용할 수 있게 한다. 이 아키텍처는 게이팅에도 동일한 사전을 사용하며, 백본의 숨겨진 상태를 각 기저 벡터와 점수화해 재구성 전 해당 계수를 변조한다. 이를 통해 문맥이 각 메모리 구성 요소를 개별적으로 제어할 수 있다.
성능 및 구성
이 방법은 개별 토큰과 다중 토큰 n-gram을 모두 다룬다. 340M 및 1B 파라미터 Transformer 백본에서 테스트한 결과 언어 모델링과 다운스트림 작업 성능이 향상됐다. 추상화 연구(ablation studies)를 통해 메모리 분기를 중간 레이어의 어텐션 서브레이어 앞에 삽입하는 구성이 효과적임이 확인됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.