前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9364
  • Apple收紧Mac全盘访问权限,剑指AI代理隐私风险
  • AI评委也会上当:评测模型审查作弊代码的深度测试
  • Meta 开源 Muse 代理硬件制作代码,支持 ESP32/树莓派
  • Mac将收紧磁盘访问权限,AI代理风险成核心理由
  • 开源 Lego AI 生成器:让 GPT/Claude 直接输出乐高 CAD 模型
  • 生产级LLM系统的状态架构设计要点
  • LLM输出JSON解析的正确做法
  • 2026年MCP Server实战入门:从零构建可用的工具服务器
  • Meta Muse Mac应用安全漏洞:零日与文件系统泄露
  • GitHub Actions添加cancel-in-progress:节省30%构建分钟数
  • MCP工具描述即指令:信任边界的安全教训
  • 7种数据格式Token消耗对比:JSON缩进比CSV多花3倍
  • LLM推理工程:KV-Cache瓶颈与PagedAttention
  • GitHub Copilot 代码审查支持 API 调用,默认改为 Balanced 级别
  • Google Workspace 更新:Gemini 3.8 语音、Google Vids 支持字幕定制、文档 API
  • GitHub Copilot 推出计算机操控功能
  • GitHub Copilot 废弃多款模型,请留意代码补全与聊天受影响
  • Cloudflare 开源 Clef 决策模型:39ms 完成 AI Agent 决策,无需人工介入
  • 苹果加强macOS全盘访问权限,防范AI Agent滥用
  • 英伟达发布 DGX Spark 64GB:1 PetaFLOP 级桌面 AI 工作站
  • Redis 作者开源 ds4:本地运行 LLM 的新方案
  • OpenAI企业级Agent平台Dots亮相,可代订外卖
  • jev-ultrafast:把浏览器操作变成多选题
  • AI Agent库的兼容性不止语义版本号
  • OpenAI悄然发布GPT-6官方使用指南
  • 远程MCP长时任务:Agent实际收到什么
  • AI Agent合规审计链路工程观察
  • Go+DiskANN+MCP 构建 AI Agent 时序记忆引擎实战
  • Copilot 桌面控制能力上线:权限模型与安全护栏详解
  • Node 拒绝 package 导入?一 CLI 告诉你根因
  • iPhone 17 Pro Max化身Mac外置GPU:Qwen 27B预填充速度提升29-44%
  • K8s"单体"经验对AI Agent架构的启示
  • GPT-6模型家族选型指南发布
  • Qwen3.8-27B-Humanlike-Chat 2.0:更像人、增工具调用、修指令遵循
  • AWS Quick+ MCP模式实现大规模合规审查
  • Bedrock AgentCore为Claude Desktop添加安全网页搜索
  • SageMaker多轮RL微调搜索Agent实战
  • Asta 快速报告生成模型 AstaBrief 开源
  • GitHub:AI时代开发者需加强的三项技能
  • 状态机设计:如何让数据字段影响状态流转
  • 收据、副本、SHA:三种验证方式的本质区别
  • 心跳驱动:无存储的 Agent 健康状态追踪
  • LMCP:让 AI 编程工具直接操控 Mac 原生应用的 MCP 服务器
  • Anthropic开放Claude Code模组自定义功能
  • Airbnb如何用AI重塑产品开发与用户体验
  • Meta Muse Agent登陆智能眼镜:云端Linux虚拟机运行,可代打电话/购物
  • Cloudflare AI Gateway支持网页搜索API
  • GPT-6 Astra用Agent在魔兽世界完成首秀
  • 英伟达DGX Spark 64GB版4999美元开售,支持4机集群扩展
  • DGX Spark深度解析:vLLM/llama.cpp专项优化,Perplexity已适配
  • Jev开源替代方案:五款自托管决策模型推荐
  • 已加载 51 / 9364
8.0
热点
AI SCORE
开源项目2026-10-03 02:01

Redis 作者开源 ds4:本地运行 LLM 的新方案

Hacker News#Redis#开源#本地LLM
Editor brief · 编辑速览

Redis 创建者推出的本地 LLM 运行工具 ds4,提供轻量级推理能力,适合想在本地环境部署和实验语言模型的开发者。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

DS4 · 本地前沿推理引擎

DwarfStar 4 是一个面向高内存 Mac、CUDA 和 ROCm 机器的精简 C 推理引擎。支持 DeepSeek V4 和 V4.1 Flash、GLM 5.x 及 Qwen3.8 Flash Next,集文本模型、视觉模型、本地 API、CLI 和原生 Agent 于一套技术栈。

支持模型:DEEPSEEK V4 / V4.1 + GLM 5.x + QWEN3.8 · MIT 许可证 · C / METAL / CUDA / ROCM · 64GB 可跑 QWEN

原理 · 本地模型技术栈

一颗 2840 亿参数的星辰

DeepSeek V4 Flash 是一个大型混合专家模型。通常的路径是远程服务;ds4 则从相反的约束出发。

第二阶段 · 压缩

压缩,而非阉割

非对称量化有选择地压缩路由专家,同时保留关键路径。模型因此在高内存机器上变得实用。

第三阶段 · 矮星

密集、驻留、属于你

本地引擎对外暴露 CLI、HTTP API 和原生 Agent,三者共享同一份模型状态和缓存。

非对称 2-bit 量化

压缩路由专家,保持关键共享路径精确。这就是有路由的 MoE 模型如何适配目标机器的。

KV 缓存作为磁盘公民

将长前缀保存到 SSD,通过 prompt hash 恢复。重启不必意味着完整的重新预填充。

一个引擎,三种接口

用 ./ds4 做对话,用 ./ds4-server 启动本地 API,用 ./ds4-agent 进行持久化的编程会话。

运行时架构图 · 简化版,完整架构见架构笔记。

步骤 1 · 获取权重

git clone https://github.com/antirez/ds4
cd ds4 && ./download_model.sh ds4f-q2

步骤 2 · 为你的后端编译

make  # macOS · Metal
make cuda-spark  # Linux · DGX Spark
./ds4
./ds4-server --ctx 100000  # 或者启动一个 API 服务

V4 Flash Q2 是基准模型。128GB 内存下,GLM 5.3 Q2 和 Qwen Q4 也能装下;V4.1 Q2 可从 SSD 流式运行。

./download_model.sh ds4f-q2 && make

参考性能 · M5 MAX 128GB · 32K CTX:生成 34.4 T/S · 预填充 557 T/S

以上数据来自 ds4 基准测试表。完整指南见硬件与安装文档。

掌控你的本地 AI 推理。

从快速入门开始,查看硬件配置表,然后将你的编辑器、Agent 或 API 客户端连接到本地服务。

Original source

本文由 AI 翻译整理自 Hacker News,原文版权归原作者所有。

阅读英文原文
上一篇
英伟达发布 DGX Spark 64GB:1 PetaFLOP 级桌面 AI 工作站
下一篇
OpenAI企业级Agent平台Dots亮相,可代订外卖