通过实测对比展示 Codex+Flash 与 Claude Code+Flash 在长任务中的表现差异,指出运行时(协议、工具、上下文恢复等)对 Agent 效果的决定性影响。模型本身只是完整系统的一个维度。
相同的 DeepSeek V4 Flash,不同的 runtime,结果却迥然不同。
我本地的样本是有限的:Codex + Flash 完成了一个长期、跨文件、反复验证的卡片组任务;Claude Code + Flash 启动了多个审查,但其质量没有被独立验证。这说明不同的配对方式各有所长,而不是存在通用排名。
有用的单位不是一个模型 ID。而是一个完整的 runtime:model × protocol × tools × context × recovery × acceptance。
Protocol 是一个轨迹接口。它定义了目标、工具结果、中间状态和续接如何被表示。一个兼容层可以成功连接,但仍然会失去长视野的可供性。
Tools 是合约,不是按钮。Schemas、参数、返回格式和失败信号定义了行为空间。相同的"read"或"edit"标签在不同的 runtime 中可以表现不同。
Context 和 recovery 使本地智能具有持久性。一个长任务需要保留约束、保留失败证据、检测漂移、返回到稳定点并重新规划。
Acceptance 定义了完成。Agent 的"完成"是一个自我报告。交付意味着文件状态、测试、预览、权限和外部事实与原始目标一致。
DeepSeek 的公开更新提及其 Harness minimal mode for code-agent benchmarks,说 V4 Flash 是为 Codex 适配的,并记录了 Responses API 支持。公开的 Code Harness 招聘语言强化了战略方向。这些是产品信号,而非通用优越性的证明。
Effective Agent = Model potential × Harness realization rate
realization rate 可以分解为 protocol matching、tool-contract reliability、context/recovery quality 和 acceptance evidence。更可信的比较会固定后端模型 ID、任务、代码状态、客户端版本、effort、权限和验收标准;重复任务;然后记录工具错误、返工、人工干预和回滚。
如果这些条件无法固定,将结果称为 runtime observation——而不是模型排行榜。
模型可能设定了上限。Runtime 决定了有多少上限能到达实际工作。
你现在使用的 Agent 中最薄弱的层是什么?
声明:本文由 AI 协助撰写,由作者审阅。
如需进一步行动,你可以考虑屏蔽此人和/或举报滥用。