AI Briefing

Inco AI, Apple Silicon 전용 추론 엔진 Splash 공개

Splash: 범용 엔진 대신 모델마다 커널과 초안 모델을 새로 만드는 Apple Silicon 추론 엔진

·2026.09.20 11:00

핵심 내용

Inco AI가 모델별 전용 커널과 초안 모델을 적용한 Apple Silicon 추론 엔진 Splash를 공개했다.

1 / 6

자세히 보기

Inco AI가 범용성을 포기하고 모델별 전용 커널, 초안 모델(Draft Model), 메모리 계획을 최적화한 Apple Silicon 전용 추론 엔진 Splash를 공개했다. 이 엔진은 코딩 에이전트 환경에서 요구되는 다중 요청 및 장기 컨텍스트 처리 한계를 극복하기 위해 설계되었다.

핵심 기술 및 성능

Splash는 DFlash 2 추측 디코딩 기법을 기본 경로로 사용하며, 블록 전체 병렬 예측 후 대상 모델이 한 번 검증하는 방식을 채택했다. M5 Pro(48GB) 기준 Qwen3.8-27B 모델에서 짧은 프롬프트 시 초당 74토큰, 32K 프롬프트 시 54토큰의 출력 속도를 기록했다. 특히 32K 컨텍스트 캐시 적중 시 첫 토큰 지연(TTFT)은 282ms로, 경쟁 엔진 대비 6.6~7.3배 빠르다.

벤치마크 및 비교

SPEED-Bench 결과, Splash는 기존 엔진 대비 디코딩 속도가 27B 모델에서 2.0배, 35B 모델에서 1.7배 향상되었다. 동시 요청 4개 처리 시 합산 처리량은 차순위 엔진 대비 2.0~3.9배 높으며, 48GB 기기에서 27B 모델의 16개 동시 요청을 모두 처리할 수 있다. 이는 범용 엔진이 9개 처리하는 것과 대비된다.

설치 및 요구 사항

  • 요구 사양: M3 이상 칩, macOS 26.4 이상, 통합 메모리 36GB 이상(48GB 권장)
  • 설치: brew install incoai/tap/splash
  • 실행: splash serve --model incoai/Qwen3.8-27B-Splash (127.0.0.1:8000 서빙)
  • 라이선스: Apache 2.0 (모델 가중치는 별도 라이선스 적용)

OpenAI 및 Anthropic API 호환성을 지원하며, LM Studio Bionic에 1급 추론 엔진으로 통합되었다. 현재 Qwen3.8-27B와 Qwen3.6-35B-A3B 두 가지 패키지가 4비트 양자화 및 DFlash 2 초안 모델 포함 형태로 제공된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.