ds4.c (GitHub 저장소)
ds4.c는 DeepSeek V4 Flash 전용 Metal 추론 엔진과 서버를 소개했다.
ds4.c는 DeepSeek V4 Flash 전용으로 만든 소형 네이티브 추론 엔진이다. Metal 그래프 실행기를 중심으로 DS4 전용 로딩, 프롬프트 렌더링, KV state, 서버 API 연동부를 묶었고, 범용 GGUF 러너나 프레임워크가 아니라 한 모델에 맞춘 실행 경로를 택했다.
제작진은 활성 파라미터가 적어 속도가 빠르고, thinking 모드에서도 max thinking을 피하면 사고 구간이 짧고 문제 복잡도에 비례한다고 본다. 1M 토큰 컨텍스트, 더 나은 영어·이탈리아어 출력, 압축된 KV cache와 디스크 지속성, 그리고 특수한 2-bit quantization이 강점으로 제시된다. 이 2비트 조합은 코딩 에이전트와 도구 호출에서도 안정적이라고 주장한다. 1M 컨텍스트는 약 26GB 메모리를 잡아먹기 때문에 128GB 맥에서는 100~300k 정도가 현실적이라고 본다.
개발 방향은 엔진, 특화 GGUF, 그리고 에이전트 기반 검증을 함께 맞추는 것이다. 공식 구현의 logits와 장문 컨텍스트 테스트로 맞춰 보고, 개발은 인간이 아이디어·테스트·디버깅을 주도하고 GPT 5.5가 강하게 보조했다고 밝힌다. 현재 코드는 알파 품질이며, llama.cpp와 GGML의 커널·GGUF 생태계·양자화 설계에서 많은 부분을 가져왔다. 전체 구현은 Metal-only이고, CPU 경로는 정확성 확인용이지만 현재 macOS 버그 때문에 커널 크래시 위험이 있다고 경고한다.
- 모델 가중치는 이 프로젝트용 DeepSeek V4 Flash GGUF만 지원하며, 임의의 GGUF는 텐서 레이아웃·양자화 조합·메타데이터·MTP state가 맞지 않는다.
q2/q4는 특수한 비대칭 2비트 양자화를 쓰며, routed MoE experts만 압축하고 up/gate는IQ2_XXS, down은Q2_K로 둬 품질을 지킨다.q2는 128GB RAM급,q4는 256GB 이상 머신용이다../download_model.sh mtp로 받는 MTP는 선택적 speculative decoding이지만, 아직 소폭 속도 개선 수준이다.- CLI는
-p원샷과 대화형ds4>모드를 제공하고,/think,/think-max,/nothink,/ctx N,/read FILE,/quit같은 명령으로 사고 모드와 컨텍스트를 제어한다. - 서버는 OpenAI/Anthropic 호환 API(
POST /v1/chat/completions,POST /v1/completions,POST /v1/messages)와 SSE 스트리밍, 도구 호출을 지원하며 하나의 Metal 워커에서 순차 처리하고 배치는 하지 않는다. - 에이전트 클라이언트는 서버
--ctx이하로 컨텍스트를 맞추고, 출력 한도384000토큰으로 매우 긴 응답을 허용한다. - 벤치마크는 M3 Max 128GB q2에서 short 58.52/26.68, long 250.11/21.47을 기록했고 M3 Max q4는 N/A였다. M3 Ultra 512GB에서는 q2가 84.43/36.86과 468.03/27.39, q4가 78.95/35.50과 448.82/26.62를 보였다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.