Show HN: Reame – 실행될수록 빨라지는 CPU 추론 서버
·2026.07.12 01:27
저사양 CPU 환경에서 KV 캐시 재사용과 n-gram 아카이브를 통해 추론 효율을 극대화한 LLM 서버입니다.
Reame는 llama.cpp를 기반으로 구축된 경량 LLM 추론 서버로, 저사양 CPU 및 ARM 환경에서도 효율적인 추론이 가능하도록 설계되었습니다.
주요 기술적 특징은 다음과 같습니다:
- Persistent shared-prefix KV cache: 프롬프트 접두사(prefix)를 디스크에 스냅샷으로 저장하고 재사용하여, 반복되는 시스템 프롬프트 등에 대한 연산 비용을 절감합니다.
- Palimpsest: 생성된 결과물을 n-gram 아카이브로 저장하여, 유사한 요청이 들어올 경우 모델 연산 없이 즉시 초안을 작성합니다.
- Self-regulating speculative decoding: 작은 드래프트 모델이나 n-gram 룩업을 통해 토큰을 예측하며, 하드웨어 성능에 따라 이 기능의 효율성을 스스로 측정하여 활성화 여부를 결정합니다.
- The Conclave: 동일 프롬프트에 대해 N개의 후보 답변을 병렬 생성한 뒤, 다수결로 최적의 답변을 선택하여 모델의 변동성을 보완합니다.
- OpenAI 호환 API:
/v1/chat/completions등 OpenAI API 규격을 지원하여 기존 클라이언트와 즉시 연동 가능합니다.
이 서버는 범용적인 대화형 AI보다는 문서 추출, 분류, 배치 파이프라인, SaaS 내 AI 기능 구현 등 반복적이고 특정 도메인에 특화된 워크로드에 최적화되어 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.