新研究表明AI编程助手对任务耗时的估计严重偏离实际,Coze误差高达10倍,同时自我评分高出实际约20个百分点,对长时间自主任务监控构成挑战。
一项新研究发现,流行的编程助手无法预测任务需要多长时间,也无法可靠地判断自己已经工作了多久。这对于长时间运行的任务来说是个问题。
当 AI 助手处理一个任务时,它通常不知道时间过去了多少。这是两位独立 AI 研究人员在 MATS 研究项目中得出的一项结论。他们测试了两款广泛使用的编程助手——Anthropic 的 Claude Code 和 OpenAI 的 Codex——在时间感知方面的表现。
在每个编程任务开始前,Agent 需要估算自己需要多少时间。然后它们完成任务,回顾时报告已经过去了多久。测试材料来自 ProgramBench 收藏中的 200 个任务,以及研究人员自己的 18 个基准测试套件。
在测试中,Agent 一贯高估了自己需要的时间。在 ProgramBench 上,两个模型大多猜测大约 90 分钟,不管难度如何。在第二轮测试中,Claude 的误差平均达到 3 倍,Codex 达到 6 到 10 倍。短任务的估算最不准确,只有在数小时范围内的一些预测才接近现实。

结果会因模型运行的软件配置不同而改变。Claude Code 持续工作直到它认为任务完成,中位数约为 90 分钟。另一方面,Codex 大约在半小时后停止,几乎不考虑任务本身。根据这项研究,同一个语言模型在 Claude Code 中平均比在 Codex 中多花费 2.5 倍的步数。因此,运行时间取决于模型本身,也严重依赖于周围的软件——即所谓的 harness。
Agent 在判断自己工作质量方面同样不可靠。更老的模型 Opus 4.8 和 GPT-5.5 平均高估自己的结果 20 分,即使任务失败也给自己打高分。在一个案例中,两者都认为自己的工作成功率约为 70%。实际得分分别为 7% 和 14.5%。

研究人员表示,这种自我评估能力很重要。对于一个能够可靠地处理长达数小时的长任务的 Agent,它必须能够遵循类似"在这个任务上迭代两小时"这样的指令。一个经常误判时间的 Agent 很难控制。接下来,作者希望测试 Agent 是否能够遵守设定的工作时长。当 Agent 可以使用一个报告已用时间的工具时,它们几乎每次都能正确判断。