Redis 创建者推出的本地 LLM 运行工具 ds4,提供轻量级推理能力,适合想在本地环境部署和实验语言模型的开发者。
DS4 · 本地前沿推理引擎
DwarfStar 4 是一个面向高内存 Mac、CUDA 和 ROCm 机器的精简 C 推理引擎。支持 DeepSeek V4 和 V4.1 Flash、GLM 5.x 及 Qwen3.8 Flash Next,集文本模型、视觉模型、本地 API、CLI 和原生 Agent 于一套技术栈。
支持模型:DEEPSEEK V4 / V4.1 + GLM 5.x + QWEN3.8 · MIT 许可证 · C / METAL / CUDA / ROCM · 64GB 可跑 QWEN
DeepSeek V4 Flash 是一个大型混合专家模型。通常的路径是远程服务;ds4 则从相反的约束出发。
非对称量化有选择地压缩路由专家,同时保留关键路径。模型因此在高内存机器上变得实用。
本地引擎对外暴露 CLI、HTTP API 和原生 Agent,三者共享同一份模型状态和缓存。
压缩路由专家,保持关键共享路径精确。这就是有路由的 MoE 模型如何适配目标机器的。
将长前缀保存到 SSD,通过 prompt hash 恢复。重启不必意味着完整的重新预填充。
用 ./ds4 做对话,用 ./ds4-server 启动本地 API,用 ./ds4-agent 进行持久化的编程会话。
git clone https://github.com/antirez/ds4
cd ds4 && ./download_model.sh ds4f-q2
make # macOS · Metal
make cuda-spark # Linux · DGX Spark
./ds4
./ds4-server --ctx 100000 # 或者启动一个 API 服务
V4 Flash Q2 是基准模型。128GB 内存下,GLM 5.3 Q2 和 Qwen Q4 也能装下;V4.1 Q2 可从 SSD 流式运行。
./download_model.sh ds4f-q2 && make
以上数据来自 ds4 基准测试表。完整指南见硬件与安装文档。
掌控你的本地 AI 推理。
从快速入门开始,查看硬件配置表,然后将你的编辑器、Agent 或 API 客户端连接到本地服务。