Redis 作者 antirez 发布 DwarfStar 推理引擎,可在 Mac/DGX Spark/Strix Halo/旧 NVIDIA 显卡上本地运行 DeepSeek V4 Flash、GLM 5.x 等模型。
Redis 的作者认为你的旧 GPU 还没有过时。Salvatore Sanfilippo,更广为人知的名字是 antirez,发布了一个名为 DwarfStar 的项目(仓库地址是 antirez/ds4),它可以在消费级硬件上完全本地运行 DeepSeek V4 Flash、GLM 5.x 和 DeepSeek V4 PRO:Mac、DGX Spark 主机、Strix Halo 台式机,以及较老的 NVIDIA 显卡如 Ada Lovelace 和 L40S。它在本周登上了 Hacker News 榜首,获得了数百个点赞,仓库 star 数已超过 21,000。
有趣之处不仅在于速度数字本身,更在于支撑这些数字的设计决策。DwarfStar 并没有像 llama.cpp 那样做一个通用的 GGUF 运行时,而是刻意收窄了范围:它只支持一个简短的模型列表,自带量化权重,并对整个技术栈进行端到端测试——从张量加载到工具调用再到 HTTP 服务器。每个模型都要做到感觉真正完工。
在继续之前先做完整说明:我没有在自己的机器上运行过 DwarfStar。以下所有内容都来自项目的 README 和 GitHub 上的官方文档,文中都有内链。这是一篇介绍它能做什么、需要什么硬件、以及如何配置的使用指南,而非个人基准测试报告。我会在文档如实承认局限性的地方特别标注。
README 中有几个关键事实,构成了理解其他一切的基础:
它是一个独立的 C 语言原生推理引擎(ds4.c),采用 MIT 许可证,不依赖 GGML,尽管文档中明确表示 llama.cpp 的内核和量化工作是它的基础。
支持的模型:DeepSeek V4 Flash(含视觉版本)、DeepSeek V4.1 Flash、DeepSeek V4 PRO、GLM 5.2、GLM 5.3、GLM 5.3 Flash 以及 Qwen3.8 Flash Next。
后端:Apple Silicon 上的 Metal(主要目标平台)、CUDA(含多 GPU 配置)以及 Strix Halo 系统上的 ROCm(如 Framework Desktop)。
它明确标注为 beta 质量。文档的状态(Status)部分写明了这一点,模型支持策略也是"有意为之的机会主义":某个模型可能在有更好的替代品出现时被移除。
最后这一点很重要,如果你正在将它与 llama.cpp 或 Ollama 做比较的话。那些工具试图运行一切。DwarfStar 则试图在人们实际拥有的机器上完美运行少数几个模型。你不能随意丢一个 GGUF 文件进去;文档明确说明其他文件会失败,因为张量布局、量化组合和元数据都特定于项目发布的权重。
DeepSeek V4 Flash 和 GLM Flash 模型都是混合专家模型。它们的大部分参数是路由专家,而每个 token 只有一小部分被激活。两个后果使得本地推理变得实际可行:
激进的量化可以存活。文档解释了 Q2 方案将大部分压缩用于路由专家(IQ2_XXS 版本的 gate/up 张量,Q2_K 版本的 down 张量),同时将注意力投影、共享专家和输出层保持在高得多的精度。结果是 Flash Q2 大小约为 81 GiB,小到可以在 96 或 128 GB 的机器上运行。
大上下文保持廉价。DeepSeek V4 的 KV cache 设计对上下文进行了激进压缩,这就是为什么服务器可以在一台机器上用 100K token 的上下文启动。
这就是为什么同一个量化模型在稠密架构中会毫无希望,而在 antirez 在 README 中自己的话说,感觉像是"准前沿(quasi-frontier)"的原因。
这是大多数人最容易搞错的决定,所以这里直接引用文档中的矩阵。
96 到 128 GB Apple Silicon Mac。默认路径。 下载 ds4f-q2,运行 ./ds4。这是项目视为基准的配置。
内存更小的 Mac,RAM 不够跑模型。SSD 流式传输。 引擎在 RAM 中保留一个有限大小的路由专家缓存,从 SSD 上的 GGUF 文件读取缺失的部分。它用速度换容量,文档直接说明模型可以成功启动但对交互式工作来说仍然太慢,所以先用短文本生成测试一下。
DGX Spark。 make cuda-spark。这是 antirez 称为主要 CUDA 目标的硬件。
较老的 NVIDIA 显卡,包括 Ada Lovelace 和 L40S。 make cuda-generic。这是其他后端经常不支持的部分。文档报告了一个八卡 L40S 配置运行 Flash Q2,聚合速度约为每秒 126 tokens,在 16 个并发会话下,本质上是一台用落后一两代 GPU 构建的小型多用户 LLM 服务器。
两台 128 GB Mac。 通过 RDMA 做张量并行,足够运行 4-bit DeepSeek Flash 或 GLM 5.3 Flash。
512 GB 工作站。 完整常驻 DeepSeek V4 PRO Q4,在 M3 Ultra 上测试通过。
SSD 流式传输的数字值得关注,因为它改变了"我笔记本跑不动那个模型"的含义。在 128 GB M5 Max 上启用自动缓存大小调节,文档中 9 月的测量数据显示:GLM 5.3 Flash Q4(177.77 GiB 文件)初始 prefill 速度为每秒 121 tokens,生成速度约为每秒 12 到 15 tokens(三次运行中位数)。DeepSeek Flash Vision MXFP4(145.26 GiB)达到每秒 300 tokens 的 prefill 速度和约每秒 12 到 19 tokens 的生成速度。这些是从快速内部 SSD 读取得到的速度,不是营销话术,文档也注明了你的负载会有所不同。
git clone https://github.com/antirez/ds4.git
cd ds4
make # Metal on Apple Silicon
./download_model.sh ds4f-q2
然后选择交互式 CLI、内置 agent 或服务器:
./ds4 -p "Explain Redis streams in one paragraph."
./ds4-agent
./ds4-server --ctx 32768
启动前有几个值得了解的细节:
下载支持断点续传。 中断后重新运行 ./download_model.sh ds4f-q2 会用 curl -C - 继续。这个功能在文件有 81 GiB 时很重要。
在模型之外预留预算内存。 文档警告要为上下文、运行时缓冲区和操作系统留出空间。模型大小是地板,不是需求。
使用快速的本地 SSD。 每种流式传输模式都依赖它,V4.1 文档用加粗的同等措辞说明:将 GGUF 放在快速本地 SSD 上,因为 Engram 表直接从磁盘读取。
ds4-server 在 8000 端口暴露一个 OpenAI 兼容的端点,而附带的 ds4-agent 是一个原生编程 agent,它将 token 历史和实时模型状态一起保存在本地 KV 快照中,所以恢复会话不需要重建整个 prompt。
文档包含了将本地 DeepSeek 接入真实 agent 工具的现成配置:
Claude Code。 一个 shell 包装器将 ANTHROPIC_BASE_URL 指向本地服务器,并将包括子 agent 在内的每个模型角色指向 deepseek-v4-flash。
Codex CLI。 一个 TOML provider 块,使用 Responses API 指向 127.0.0.1:8000。
OpenCode 和 Pi。 JSON provider 条目,已经解决了兼容性标志,包括 DeepSeek 的 thinking 格式。
最后这一公里才是将它与基准测试玩具区分开来的东西。Pi 配置中的 cost 字段直接设为零,推广语很简单:给你的编程 agent 无限本地 tokens,同时拥有一台从不对外联络的机器的隐私。代价是能力。DeepSeek V4 Flash 很强大,但在最困难的任务上它与前沿托管模型并不一样,文档自己的评估部分谨慎地将 ds4-eval 称为"集成检查,不是官方排行榜分数"。
同一份文档中的两个诚实警告:
Beta 质量,快速迭代。 版本之间可能出现不稳定和回归。
一个你应该知道的 flag: --power。对 DeepSeek 来说,它用吞吐量换更低的持续 GPU 负载,默认值是 100。如果你的笔记本连续几小时都很烫,这个 flag 就是为你准备的。GLM 目前要求保持 100。
README 有一个名为"AI full disclosure"的章节,antirez 在其中声明软件是在 AI 编程 agent 的强力协助下开发的,人类负责创意、测试和调试,并坦诚地说如果你对 AI 开发的代码不满意,这个项目不适合你。他还主张软件现在应该作为最大使用场景的工作模板来发布,用户向编程 agent 提问让它适配到自己的特定硬件。
不管你是否同意这个哲学,这是一位用手写了二十年基础架构的人发出的值得注意的立场。致谢部分则清楚地划了一条线:这个项目重度依赖 AI,而使它成为可能的 llama.cpp 和 GGML 则主要是手写的。
你有 96 GB 以上统一内存,想要一个私有的、免费的编程模型:是的,这可能是目前通往 DeepSeek V4 Flash 最成熟的路径。
你有闲置的较老 NVIDIA 显卡:是的。Ada Lovelace 和 L40S 多卡故事不同寻常,值得测试。
你有 32 GB 笔记本:不行。Flash Q2 文件本身就有 81 GiB,流式传输需要大容量 SSD 和现实的性能预期。
你想要一个通用的本地 LLM 运行器来跑很多模型:不行,用 llama.cpp 或 Ollama。DwarfStar 的设计就是和你对着干。
你想先原型验证:OpenAI 兼容的服务器意味着你可以将任何现有工具指向 127.0.0.1:8000,在提交磁盘空间之前自己评估质量。
更大的故事是它对本地 AI 未来一年的说明。每个模型家族专用引擎、围绕 MoE 稀疏性构建的量化方案、以及将 SSD 作为 RAM 的扩展——所有这些已经在一个项目中实现了。"消费级硬件"和"运行前沿级模型"之间的差距持续缩小,而这次缩小它的人创建了 Redis。