InfiniteKV: 무한 컨텍스트를 위한 KV 캐시 오픈소스
Open sourcing InfiniteKV: a KV cache that files old tokens as 104-byte searchable records in RAM or on disk instead of deleting them. Mistral-7B answered from token 76,747, 2.3x past its trained window. Colab demo
·2026.06.12 15:34
KV 캐시를 압축하여 RAM이나 디스크에 저장함으로써 모델의 컨텍스트 길이를 획기적으로 확장하는 InfiniteKV가 공개되었습니다.
기존 LLM 서비스는 VRAM 부족 문제를 해결하기 위해 오래된 토큰을 삭제하는 슬라이딩 윈도우 방식을 사용하지만, InfiniteKV는 이를 완전히 새로운 방식으로 접근합니다.
이 기술은 메모리를 두 영역으로 분리합니다. 가장 최근의 256개 토큰은 GPU 메모리에 고정하여 성능을 유지하고, 그 이전의 토큰들은 104바이트 크기의 압축된 레코드로 변환하여 일반 RAM이나 디스크에 저장합니다.
주요 특징 및 성능:
- 메모리 효율성: 100만 토큰 처리 시 기존 float16 방식은 약 122GB의 VRAM이 필요하지만, InfiniteKV는 약 3GB의 레코드만 사용하여 일반 PC에서도 구동이 가능합니다.
- 검색 기반 어텐션: 새로운 토큰이 생성될 때마다 저장된 레코드 중 가장 관련성이 높은 과거 토큰을 검색하여 모델의 컨텍스트에 포함시킵니다.
- 검증된 성능: Mistral-7B 모델을 대상으로 테스트한 결과, 학습된 컨텍스트 윈도우(32,768)를 훨씬 초과한 76,747번째 토큰에서도 정확한 답변을 생성하는 것을 확인했습니다.
- 데이터 무결성: 모든 결과는 JSON 레시피 형태로 제공되어 실험 환경과 결과의 재현성을 보장합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.