OpenAI开源Codex Agent Harness,将应用服务器、协议、工具调用三大层面解耦。选错技术面将付出大量无用工程代价。
背景:一周内两个框架同时开源
8月19日,OpenAI Developers 发布了一篇标题异常直白的文章:Codex as a platform: build on the open agent harness。第二天,Greg Brockman 在 X 上转发了这条消息,并重新挖出了一个5月的案例研究:Thrive Holdings 与会计网络 Crete Professionals Alliance(已于6月更名为 Current)基于 Codex 构建的税务申报系统,处理了7000份退税,并将会计人员的准备时间缩短了约三分之一。这条新闻的分量不在于某个模型,而在于"harness"这个词。harness 是包裹在模型外层的部分:Agent 循环、上下文收集、工具执行、沙箱、审批流程、多轮状态管理。两年来,各实验室一直将其视为核心资产并严加保密。如今 OpenAI 已在 Apache-2.0 许可下将整个 Codex harness 公开在 GitHub(openai/codex)上——可阅读、可修改、可商业嵌入、无版权约束。时机几乎完美得过头。六天前,DeepSeek 也开源了自己的 Agent 运行时 DeepSeek Harness v0.1,采用 MIT 许可,基于 Cordis 插件系统,在数小时内就获得了23000个 GitHub star。两家前沿实验室在同一周内都交出了自己的"骨架"。对开发者而言,这是一个结构性转变:Agent 系统中最难的部分正在成为公共基础设施,而模型已被降级为可以随时替换的组件。
如果你的反应是"不过是个循环加几个工具调用",OpenAI 的另一篇文章值得一读:How enabling two settings tripled our ARC-AGI-3 scores。他们没有换模型,没有重新训练,只是在 harness 层翻转了两个开关:保留推理(preserved reasoning)和上下文压缩(context compaction)。GPT-5.6 Sol 的 ARC-AGI-3 分数从13.3%跃升至38.3%,接近3倍的提升。输出 token 数量降至原来的约六分之一。这个数字值得每一个构建 Agent 的人停下来思考。同样的模型、同样的基准测试——仅仅因为外层编排方式改变了,能力和成本都获得了近一个数量级的改善。换句话说:我们一直被训练成将"结果不够好"归咎于"模型不够好",然后转向更贵的模型。开源的 harness 告诉你:相当一部分开销其实一直可以通过架构优化来节省。
Codex 开放的不是一个模糊的"框架",而是三个清晰分离的层面。选错任何一个都会让你付出大量无谓的工程代价,所以有必要先把它们理清楚:

app-server 是文章的重点。它既是一种协议,也是一个长驻进程,内部由 stdio 读取器、消息处理器、线程管理器和核心线程组成,线程管理器为每个线程创建一个核心会话。该协议是双向的——服务器可以主动发起请求(例如当需要人工审批时),并暂停本轮直到客户端响应。OpenAI 坦诚地承认了一个早期的错误决策:他们最初尝试将 Codex 作为 MCP 服务器暴露,但发现 MCP 的语义很难延伸到 IDE 所需的丰富交互——diff 更新、工作区探索、流式推理——所以他们转而构建了 JSON-RPC 协议。这对任何构建 Agent 平台的人都是有价值的教训:MCP 很适合把 Agent 当作可调用工具使用,但不适合将 Agent 作为产品的核心。要把这个模式具体化,OpenAI 发布了一个名为 Relay 的示例应用:一个虚构的物流运营仪表盘,Agent 通过应用自己的 MCP 工具获取实时数据,用户点击"比较恢复选项"等建议操作,而不是面对一个空白的提示框,任何写操作(如重新预订货运)都会在执行前经过人工审批。GitHub 和 JetBrains 在各自的工作流中嵌入了 Codex;Cisco 在 App Builder 中使用它——这些都是 app-server 协议的下游应用。
有一个边界值得明确说出来:harness 是免费的,但推理不是。OpenAI 自己的文档写得很清楚——你可以自由阅读和修改代码,但要运行任何东西仍需要向模型认证。开源仓库处理 Agent 线程、工具执行、配置和审批;模型访问则需要 ChatGPT 账户或 API 配置。所以现在的格局是这样的:
骨架层:商品化、开源、零成本、自由替换(Codex harness / DeepSeek Harness / Claude Agent SDK)
模型层:差异化明显、大多闭源、按 token 计费、价格剧烈波动
这个月在模型层发生了什么?DeepSeek V4 系列于8月16日16:00 UTC 切换为高峰/非高峰定价,高峰时段输出价格从每百万 token $0.87 升至 $3.96,缓存命中输入价格涨幅更大。GLM-5.3 于8月18日上线 API,价格为 $1.40/$4.40。Grok 4.6 于8月19日登陆 Amazon Bedrock,价格为 $2/$6,拥有50万上下文窗口和四档推理努力设置。将这两件事叠加,结论很清晰:一旦骨架不再是护城河,你的工程重心就从"怎么写一个 Agent 循环"转移到"怎么在剧烈变动的模型市场中保持后端可替换"。而这恰好是 harness 架构结构上擅长但操作上最不擅长的部分——因为每新增一个模型厂商,就意味着又多了一个 API key、又多了一张账单、又一个基础 URL、又一次对别人服务可用性的押注。
Codex harness、DeepSeek Harness 和大多数 Agent 框架有一个共同的工程特性:模型访问通过配置注入,而非硬编码。这为你提供了一个清晰的收敛点。做法很简单——将每个 harness 实例指向一个统一的基础 URL,让路由层处理多模型编排。以 wrouter.ai 为例:
from openai import OpenAI
client = OpenAI(
api_key="wr-***",
base_url="https://wrouter.ai/v1",
)
# One client, work assigned by task difficulty
# Cheap tier: the harness's high-frequency small steps (read a file, run grep, format a diff)
cheap = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Summarize the intent of this diff"}],
)
# Flagship tier: the one step that genuinely needs long-horizon reasoning
strong = client.chat.completions.create(
model="claude-opus-5",
messages=[{"role": "user", "content": "Refactor this module and propose a migration plan"}],
)
如果你走的是 Codex app-server 路线,思路完全相同——将 harness 的模型提供者配置指向路由端点,harness 内部的线程、审批和沙箱逻辑保持不动:
# ~/.codex/config.toml
[model_providers.wrouter]
name = "wrouter"
base_url = "https://wrouter.ai/v1"
env_key = "WROUTER_API_KEY"
[profiles.daily]
model_provider = "wrouter"
model = "gpt-5.6-sol"
收益对应 wrouter.ai 专为解决三个场景:稳定性。Agent 的失败模式不同于对话的失败模式。在对话中,单次429用户会自己重试。在 Agent 中,一次超时可能让一个耗时40分钟的多步骤任务打回起点。一个坏步骤污染整个轨迹。一层在下游波动时仍提供一致表面的路由层,是缓解长任务脆弱性的务实方式。完整的模型覆盖。本周就产生了三个值得测试的端点(GLM-5.3、Bedrock 上的 Grok 4.6、DeepSeek V4 Pro 0813)。与每个供应商注册、走验证流程、再配置环境变量,这套摩擦足以让评测还没开始就夭折。完整的模型目录意味着 A/B 测试只是改一个模型字符串,而非新建一个 vendor 账户。统一账单。这在 harness 时代比以往更重要。单个 Agent 任务可能触发数十次模型调用,跨越便宜和旗舰等级。当这些消费分散在四五张供应商账单里,你根本无法计算"这个功能一次调用花多少钱"。一张账单让你在一张表里看清 harness 各层消耗,然后决定哪一步可以降级、哪一步值得用旗舰模型。
表面上看,开源 Codex harness 像是 OpenAI 又发了一个工具。实际上它是公开押注下一轮竞争在哪里:下一轮差异化发生在编排层,而非模型层。Anthropic 用 Claude Agent SDK 和 MCP 下了同样的赌注。但对开发者而言,含义正好相反。当编排层免费且唾手可得,你在骨架上构建的任何差异化都会被快速抹平。真正决定产品成本和可靠性的,变成了底层那个可替换的模型接口——它的连接有多稳定、覆盖有多全面、自身的计量有多清晰。如果你要将 Codex harness 或 DeepSeek Harness 接入自己的产品,在写任何一行 Agent 循环代码之前,先理清模型出口。将 base_url 指向 wrouter.ai,用一个 key 和一张账单跑通完整模型目录,然后再回来调优你的 harness——这才是这次开源发布真正为你节省的时间。
OpenAI Developers, Codex as a platform: build on the open agent harness (2026-08-19) https://developers.openai.com/blog/codex-as-a-platform
OpenAI, Unlocking the Codex harness: how we built the App Server https://openai.com/index/unlocking-the-codex-harness/
OpenAI, How enabling two settings tripled our ARC-AGI-3 scores https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
RuntimeWire, OpenAI pitches Codex for tax prep after a 7,000-return pilot (2026-08-20) https://runtimewire.com/article/openai-codex-tax-prep-7000-return-pilot
explainx.ai, Codex as a Platform: OpenAI Opens Up Its Agent Harness to Builders (2026-08-20) https://explainx.ai/blog/codex-as-a-platform-open-agent-harness-august-2026
DataNorth, DeepSeek releases V4-Pro-0813 and open sources Harness v0.1 https://datanorth.ai/news/deepseek-releases-v4-pro-0813-and-harness-v0-1
x.ai, Grok 4.6 on Amazon Bedrock (2026-08-19) https://x.ai/news/grok-4-6-amazon-bedrock
VentureBeat, GLM-5.3 hits the API at $$1.4/$$4.4 per million tokens (2026-08-19) https://venturebeat.com/technology/glm-5-3-hits-the-api-at-1-4-4-4-per-million-tokens