연구진, 자체 컨텍스트 관리하는 CLMs 공개… 정확도 11.4%↑ 연산량 21.5%↓
·2026.10.01 23:51
핵심 내용
연구진이 자체 컨텍스트 관리 모델 CLMs를 공개해 정확도를 높이고 연산량을 줄였다.
자세히 보기
연구진이 외부 하네스에 의존하지 않고 모델이 자체적으로 컨텍스트를 관리하는 새로운 언어 모델 클래스인 **Context Language Models (CLMs)**를 공개했다. CLMs는 컨텍스트 윈도우를 모델이 제한 없이 업데이트할 수 있는 파일로 취급하여 핵심 정보를 우선순위에 따라 처리하며, 여러 컨텍스트가 공존하는 멀티 에이전트 시스템으로 자연스럽게 확장된다.
성능 및 효율성
기존 모델을 제로샷으로 활용해 CLMs를 구축한 결과, 다양한 태스크에서 현행 최신 컨텍스트 관리 전략 대비 상당한 개선이 확인됐다.
- BrowseComp-Plus: 연산량(FLOPs)을 21.5% 줄이면서 정확도를 11.4% 높였다.
- EdgeBench (12시간): 연산량을 59% 줄이면서 점수를 5% 높였다.
- 멀티 리포지토리 에이전트 스웜 (24시간): 동일한 연산 자원 하에서 개선 폭이 65% 더 컸다.
학습 및 최적화
컨텍스트 관리를 외부 제어에서 모델 내재적 행동으로 전환함으로써 인컨텍스트 및 파라메트릭 학습이 가능해졌다. 논문은 두 가지 주요 최적화 방법을 제시한다.
- Skill-Optimization Loop: 자연어 지시로 CLMs를 유도하여 컨텍스트 관리 태스크의 홀드아웃 정확도를 최대 35.9 포인트 높이고 연산량을 줄였다.
- Online Reinforcement Learning: Qwen3.5-9B에 이 방법을 적용해 BrowseComp-Plus 성능을 47.6% 개선하면서 연산량을 12% 줄였다.
서빙 인프라
효율적인 배포를 지원하기 위해 저자들은 CLM 서빙용 Suffix Cache Reuse를 공동 설계했다. 이 기술은 동일한 성능 수준에서 표준 SGLang 대비 서버 측 연산량을 35% 감소시킨다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.