Inco AI, Apple Silicon 전용 추론 엔진 Splash 공개
Splash: 범용 엔진 대신 모델마다 커널과 초안 모델을 새로 만드는 Apple Silicon 추론 엔진
핵심 내용
Inco AI가 모델별 전용 커널과 초안 모델을 적용한 Apple Silicon 추론 엔진 Splash를 공개했다.
자세히 보기
Inco AI가 범용성을 포기하고 모델별 전용 커널, 초안 모델(Draft Model), 메모리 계획을 최적화한 Apple Silicon 전용 추론 엔진 Splash를 공개했다. 이 엔진은 코딩 에이전트 환경에서 요구되는 다중 요청 및 장기 컨텍스트 처리 한계를 극복하기 위해 설계되었다.
핵심 기술 및 성능
Splash는 DFlash 2 추측 디코딩 기법을 기본 경로로 사용하며, 블록 전체 병렬 예측 후 대상 모델이 한 번 검증하는 방식을 채택했다. M5 Pro(48GB) 기준 Qwen3.8-27B 모델에서 짧은 프롬프트 시 초당 74토큰, 32K 프롬프트 시 54토큰의 출력 속도를 기록했다. 특히 32K 컨텍스트 캐시 적중 시 첫 토큰 지연(TTFT)은 282ms로, 경쟁 엔진 대비 6.6~7.3배 빠르다.
벤치마크 및 비교
SPEED-Bench 결과, Splash는 기존 엔진 대비 디코딩 속도가 27B 모델에서 2.0배, 35B 모델에서 1.7배 향상되었다. 동시 요청 4개 처리 시 합산 처리량은 차순위 엔진 대비 2.0~3.9배 높으며, 48GB 기기에서 27B 모델의 16개 동시 요청을 모두 처리할 수 있다. 이는 범용 엔진이 9개 처리하는 것과 대비된다.
설치 및 요구 사항
- 요구 사양: M3 이상 칩, macOS 26.4 이상, 통합 메모리 36GB 이상(48GB 권장)
- 설치:
brew install incoai/tap/splash - 실행:
splash serve --model incoai/Qwen3.8-27B-Splash(127.0.0.1:8000 서빙) - 라이선스: Apache 2.0 (모델 가중치는 별도 라이선스 적용)
OpenAI 및 Anthropic API 호환성을 지원하며, LM Studio Bionic에 1급 추론 엔진으로 통합되었다. 현재 Qwen3.8-27B와 Qwen3.6-35B-A3B 두 가지 패키지가 4비트 양자화 및 DFlash 2 초안 모델 포함 형태로 제공된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.