DeepSeek开源的插件化Agent框架dsh,将模型适配器、工具注册、会话日志、Agent循环全部设计为可替换组件,数小时内斩获35000+ star。
DeepSeek 开源了 DeepSeek Harness,这是一款基于插件架构的 Agent 框架,在数小时内就斩获了 35,000 颗 GitHub 星标。它将适配器、工具、会话日志都视为可替换的插件,直击上下文组装的痛点。
DeepSeek 开源了 DeepSeek Harness(简称 dsh),一款基于插件架构的 Agent 框架,在发布数小时内便获得了超过 35,000 颗 GitHub 星标。该框架的核心设计理念是:一切皆插件。包括模型适配器、工具注册中心、会话日志,乃至于 Agent 循环本身——每一个都可以替换成你自己的实现。
发布数小时内斩获 35,000+ 颗 GitHub 星标
插件架构:适配器、工具、会话日志、Agent 循环
agent/pre-step 事件控制模型所见内容
仅追加的会话日志覆盖所有上下文注入
可将子 Agent 工作委托给 Claude Code 和 Codex
DeepSeek 开源了 DeepSeek Harness(dsh),这是一款基于插件架构的 Agent 框架,在发布数小时内便突破了 35,000 颗 GitHub 星标。根据 @akshay_pachaar 的说法,这个框架的核心思想只有一个:一切皆插件。包括模型适配器、工具注册中心、会话日志,以及 Agent 循环本身——每一个都可以替换成你自己的实现。
这个设计的意义是结构层面的。改变一个 Agent 组装上下文的方式,通常意味着要修改框架的源代码,或者直接 fork 一份,然后在每次升级时都要为那个 fork 买单。dsh 通过让插件声明稳定的键名(如 ctx.tools 或 ctx.llm)来避免这个问题,其他插件可以通过键名来查找它们,而不是直接导入具体实现。依赖关系是声明式的而非手工排序的,所以加载顺序取决于每个插件的需求。注册过程是可逆的,卸载插件时会回滚它所注册的一切。
有一个事件叫 agent/pre-step,它决定了模型能看到什么内容。监听器可以重写声称的消息,也可以拒绝它们——这正是几乎所有自定义上下文工程会落脚的地方。这是一个深思熟虑的设计选择:dsh 没有将上下文组装埋在框架内部,而是将其暴露为单一的拦截点。
会话日志是仅追加的,涵盖了系统提示词、推理过程、工具调用、子 Agent 调度,以及每一次上下文注入。这是调试时最重要的功能。记录工具调用是常规操作,但当 Agent 行为异常时,你仍然只能猜测上下文窗口里有什么。在这里,模型可见即意味着已记录,在运行时进行断言,所以一个新的模型可见输入必然对应一条新的会话事件。
DeepSeek 是最后一家发布编程级别模型但没有官方框架来针对训练的大型实验室,现在他们终于发布了一款可以将子 Agent 工作委托给 Claude Code 和 Codex 的框架。这填补了自 DeepSeek-R1 发布以来一直存在的空白。插件架构直接解决了一个痛点——那些 fork 了 LangGraph 或 AutoGen 并自定义上下文组装的团队——dsh 的可逆注册和声明式依赖消除了维护负担。
未披露的信息包括:性能基准测试、训练算力,以及 dsh 与现有框架(如 LangGraph 或 OpenAI 的 AgentKit)的对比。GitHub 仓库链接有提供,但信源中没有展开详情。35k 星标的说法很亮眼,但除了那条推文外未经核实。
DeepSeek 开源了 DeepSeek Harness,这是一款基于插件架构的 Agent 框架,在数小时内就斩获了 35k 颗 GitHub 星标。
它将适配器、工具和会话日志视为可替换的插件,直击上下文组装的痛点。

关注 dsh 对比 LangGraph 或 AutoGen 在 Agent 编程任务上的首次独立基准测试,以及 DeepSeek 是否会发布论文详细阐述该框架的设计决策。同时追踪 GitHub 仓库的 issue 区,那里会有暴露插件 API 局限性的早期社区插件。
[2025 年 8 月 14 日更新 via the_decoder]
此次发布正值 DeepSeek 将其旗舰模型 V4-Pro 从测试阶段转出并提高 API 价格之际,缓存命中成本跃升至现行的六倍——这是针对反复读取相同文件的 Agent 工作流最陡峭的一次涨价。Harness v0.1 现已基于 MIT 许可证发布,这是原始公告中没有提到的细节。[来源:The Decoder]
[2025 年 8 月 15 日更新 via gn_claude_hooks]
早期独立测试表明 dsh 可能已经足以与成熟框架抗衡。一位开发者通宵测试了 DeepSeek Harness 后报告称,它的表现在"Minecraft 式"的方式上优于 Claude Code——据 36Kr 报道,这很可能是在说它在构建和迭代修改环境方面的能力。同篇报道还强调了 DeepSeek 公开挑战 Anthropic 的 Claude Code 的动向。虽然这只是坊间说法,但这是开源发布以来首个实测对比,为星标数量之外的真实世界性能提供了初步信号。[来源:36Kr]
原文发表于 gentic.news