AI Briefing

LLM 간 텍스트 없이 KV-cache 직접 통신하는 'Cache-to-Cache' 프레임워크 공개

·2026.09.19 03:55

핵심 내용

텍스트 생성 없이 LLM 간 KV-cache를 직접 연결해 지연을 줄이고 정확도를 높이는 C2C 프레임워크가 공개됐다.

자세히 보기

기존 멀티 LLM 시스템은 모델 간 통신을 위해 내부 표현을 텍스트 토큰으로 변환하는 과정을 거쳐야 해, 의미 정보 손실과 생성 지연이 발생했다. 이를 해결하기 위해 텍스트 생성 없이 LLM 간 직접적인 의미 통신을 수행하는 Cache-to-Cache (C2C) 패러다임이 제안됐다.

C2C는 신경망을 이용해 소스 모델의 KV-cache를 타겟 모델의 KV-cache로 투영하고 융합하여 의미 정보를 전달한다. 학습 가능한 게이팅 메커니즘을 통해 캐시 통신이 유리한 타겟 레이어를 선택적으로 활용하며, 사전 실험을 통해 KV-cache가 모델 간 통신 매체로 유효함을 입증했다.

성능 측면에서는 개별 모델 대비 평균 정확도가 6.4~14.2% 향상되었고, 기존 텍스트 통신 방식 대비 약 **3.1~5.4%**의 성능 우위를 보였다. 또한 지연 시간 측면에서 평균 2.5배의 속도 향상을 달성했다. 해당 연구는 ICLR'26에 게재되었으며, 코드는 GitHub를 통해 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.