作者回溯2024-2025年间18条带日期的AI预测,对比实际结果;包括Amodei预测"AI写90%代码"、Altman预测2025 agent爆发等,结论是行业领袖预测普遍失准。
我给过去两年里 18 条有日期的 AI 预测打了分,对照事实。记分牌很残酷,唯一得分高的人什么都没得到。
2025 年 3 月,Dario Amodei 对外交关系委员会表示,AI 将在三到六个月内写出 90% 的代码,并在十二个月内基本包揽全部。这个十二个月的截止日期已在 3 月到期。几乎没有人回去核对。
这就是 AI 预测的奇怪礼仪。预测震天响、有日期、全程信心满满,然后截止日一到,所有人都转向下一个预测了。没有记分牌。于是我自己建了一个。
2025 年 2 月,我在 Whizi 里规划了 Agent 工作流,基于 Altman 对 2025 年的判断。六周后我终止了该项目——算了一笔账:一次多步骤 Agent 运行的单次成本,对比一个固定的月度订阅。六周的产品路线图,花在了别人的预测上。我把能找到的每一条有原始来源且截止日期已过的 2024 和 2025 年预测都拉了出来。18 条符合筛选标准。
评分规则(你可以反驳):一条预测按它自己的措辞、对它自己的截止日期来评分。如果你说到 9 月达到 90%,而 9 月只带来了 30%,"呃,最终会实现的"不是评分,是借口。
Sam Altman,2025 年 1 月:"我们相信,2025 年,我们可能会看到首批 AI Agent'加入劳动力市场',并实质性地改变企业的产出。"
MIT 的 NANDA 项目在 2025 年 8 月发现,95% 的企业生成式 AI 试点项目没有产生可衡量的损益影响。卡内基梅隆大学完全用 AI Agent 组建了一家假公司,测量他们完成的办公室工作:表现最好的模型完成了 30.3% 的任务。一个只有 30% 工作能力的员工不会加入你的劳动力队伍。他们会直接被淘汰。
有一个例外让这项预测不至于得 F:在软件公司内部,编程 Agent 确实改变了产出。评分:C-。
Marc Benioff,2024 年 9 月:"我们的愿景很宏大:在 2025 年底前,用 Agentforce 赋能十亿个 Agent。"
Salesforce 报告称截至 2026 年初累计约 29,000 个 Agentforce 交易,并突破了 10 亿美元的年经常性收入。一门真实的生意,但距承诺还差约 34,000 倍——按交易数而非 Agent 数计。我最喜欢的细节:Salesforce 现在报告的是"Agent 工作单元服务数"(38 亿),而不是 Agent 数量。当你的数字达不到时,换个单位。评分:F。
Klarna,2024 年 2 月:其 AI 助手"相当于 700 名全职 Agent 的工作量"。
然后在 2025 年 5 月,CEO Sebastian Siemiatkowski 反悔了,开始重新招聘人类:"我们在效率和成本上投入过多。结果是质量下降。"AI 保留了例行工单。重要的事情都由人类回来处理。公开做实验并承认结果,给予肯定。评分:C。
Amodei 的 90%。方向对了,分母错了。Google 称截至 2026 年中,75% 的新代码由 AI 生成,高于 2024 年底的 25%,尽管这里统计的是每一个被接受的自动补全,人类在部署前仍会审核。2026 年初的行业范围估计集中在 25-41%。
所以:六个月内写出 90% 的代码,没有。十二个月内基本包揽全部,差得远。代码编写方式的结构性转变,绝对发生了。预测描述了一场真实的革命,但每个数字都错了。90% 那条评分:C+;"基本全部"那条评分:F。
Eric Schmidt,2025 年 4 月:"未来一年内,绝大多数程序员将被 AI 程序员取代。"
一年期限到了。程序员几乎在他们之前被雇用的地方都还在。真正的劳动力冲击比预测更狭窄也更残酷:斯坦福和 ADP 薪资数据显示,自 2022 年底以来,在 AI 暴露度最高的工作中,22-25 岁员工的就业率下降了约 16%,仍在萎缩。初级岗位受到冲击;绝大多数人保住了工作,只是获得了 Copilot 许可。评分:F。
还有一个完全没有人在预测列表里猜到的事实:Cursor 在大约十七个月内从年经常性收入 1 亿美元增长到 40 亿美元,2026 年 8 月 14 日 SpaceX 以 600 亿美元收购了该公司,创下有史以来最大的创业公司收购记录。我在检查的 2024 年预测列表中,没有一条包含"一个代码编辑器成为史上最大的创业公司退出案例"。
Mark Zuckerberg,2025 年 1 月,在 Joe Rogan 节目中:"可能在 2025 年,我们 Meta……将拥有一个 AI,可以有效地成为你公司里的一名中级工程师,可以写代码。"在几周后的财报电话会议上,他又为 2025 年加了两条:Meta AI 成为首个十亿用户助手,以及 Llama 成为最先进且使用最广泛的模型。
三条一条都没发生。Llama 4 发布时反应平淡,而 Gemini 3 在 2025 年 11 月夺走了前沿模型榜首。而且 Meta 整年用钱包下了相反的赌注:130 亿美元收购 Scale AI 半数股权,报告的研究员薪酬方案在 1 亿到 4.5 亿美元之间,然后在 10 月裁掉了超级智能实验室 600 人,2026 年 5 月又裁员约 8000 人。
Meta 预测了一个能像中级工程师一样写代码的 AI,结果花了一年半时间创下了人类智慧的市场最高价。评分:F。
Elon Musk,2024 年 4 月:AI"比任何单个人类更聪明,大概在明年年底"。
到 2025 年底,旗舰 xAI 模型是 Grok 4,发布时号称"世界上最聪明的 AI",在一个名为"人类最后考试"的基准测试中得分 25.4%。这个说法在考试面前没有存活下来。评分:F。
Mira Murati,2024 年 6 月:PhD 级别的智能"在特定任务上"大约十八个月内实现。
在数学上基本实现了:Google DeepMind 的 Deep Think 在 2025 年国际数学奥林匹克竞赛中正式获得金牌,比大多数 2024 年的预测提前了好几年。她用的限定词"在特定任务上"发挥了很大作用,而这正是她更张扬的同行们拒绝使用的限定词。保守版本实现了。不加限定词的版本,以 GPT-5 的"PhD 级别"品牌在 2025 年 8 月推出,结果糟糕到 Altman 承认 OpenAI"彻底搞砸了"发布。评分:B-。
Gary Marcus 在 2025 年 1 月 1 日发布了 25 条带日期的预测。业界大多数对他翻白眼。给他的可评分项打分:
"我们今年不会看到通用人工智能。"正确。
Agent 将在"2025 年被无限炒作,但远不可靠。"正确,参见前面的整个章节。
"AI 模型的利润将持续平平或不存在。"收入爆发了,但他说的是利润,而各实验室仍在烧钱。按字面意思正确。
2025 年可能没有"GPT-5 级别"的共识飞跃。GPT-5 发布了;但飞跃没有发生。精神上正确。
评分:A-。扣掉的那一分是因为这份清单里没有包含的东西:没有任何一条预测到一个 40 亿美元的编程工具赛道、IMO 金牌,或者 Agent 在唯一一个产出可验证的领域变得真正有用。2025 年最准确的预测者判断对了每一种失败,却错过了每一种成功。
而一个不舒服的二阶事实:正确没有给他带来任何东西。那些赌注押在他整个世界观对面的投资者,才是给 Cursor 定出 600 亿美元估值的人。预测准确率和财务回报走的是两套不同的记分牌,而且只有一个会复利增长。
把这 18 条预测分成两堆,噪音就消失了。
关于能力的预测——模型将能做什么——普遍应验良好,有时还提前实现。Agent 能完成的任务长度大约每四到七个月翻一番,来自 METR,这个趋势一直在。
关于部署的预测——企业会让 AI 实际做什么——几乎全线溃败。劳动力 Agent、十亿 Agent 平台、取代程序员、AI 员工:全都撞上了同样的墙——质量门槛、责任认定、集成成本,以及一个顽固的事实:一个完成 30% 任务的系统是演示,不是招聘。
Altman 说 Agent 会加入劳动力市场。它们加入了 IDE,因为 IDE 是唯一一个错误答案会被编译器而不是客户抓到的职场。
所以这是我自己在用的决策规则,拿真金白银在上头:当听到能力预测时,认真对待它,即使是那些看起来很离谱的,因为趋势线一直在赢。当听到带日期的部署预测时,把时间线翻倍,然后看看说这话的人在卖什么。
从现在起每个季度我都会给到期的东西打分,下一版开头会放上我自己的带日期预测,这样你也可以用同一套标准来审视我。打分是免费的。被打分才是代价。
如果你想知道我不工作的时候在做什么:我运营 Whizi。一个订阅、几百个模型、GPT、Claude、Kimi 等等。来把它用坏,然后告诉我发生了什么。