回顾 2026 年截至目前的 LLM 发展,Claude Opus 4.5 和 GPT-5.1 发布,Claude Code 和 Codex 等编程助手从「常出错」跃升至可日常使用。
周五我在圣何塞举行的 WeAreDevelopers World Congress North America 大会上做了闭幕主题演讲。我将过去一年的关键趋势串联成一条时间线,探索 2026 年发生的一切。演讲视频已发布在 YouTube 上;以下是配合演讲的带注释幻灯片和笔记。
我要给大家快速概览 2026 年截至目前发生的一切。今年还没结束呢!
对我来说,2026 年从 2025 年 11 月就开始了,比大多数人早几个月。
11 月发布了两款重要模型:Claude Opus 4.5 和 GPT-5.1。
与往常一样,新模型的发布都是对前代模型的渐进式改进。
但每当模型有所提升时,它偶尔会越过一条看不见的线——一些之前不太奏效的东西开始变得可行了。
在这次的情况下,开始奏效的是它们的编程智能体。Claude Code 自 2025 年 2 月就已存在,Codex 则稍晚一些。
这两款新模型搭配各自的编程智能体框架后,从「经常出错」提升到了「足够可靠,可以日常使用」。
过去几年,我一直在用「生成一只骑自行车的鹈鹕的 SVG 图片」来评估新模型。这大概是世界上最愚蠢的基准测试——从中能学到的东西毕竟有限。
但这对模型来说仍然是个挑战,因为画鹈鹕很难,画自行车也很难,何况鹈鹕本来就骑不了自行车。
以下是 2026 年 11 月时的最高水平。Claude 还是不太会画自行车!GPT-5.1 的自行车车架也相当糟糕。
同样在 11 月,一个名为「Warelay」的冷门 GitHub 仓库收到了第一次提交。我们稍后会回到这个仓库。
然后就是 12 月假期,个体开发者们休息了一段时间,许多人开始尝试这些新的编程智能体模型组合……我们开始意识到它们能做多少以前做不到的事。
到了一月,我们很多人都迫不及待想把这些东西付诸实践。
每年我都会给自己定一个新年决心,而且据我记忆所及,这么多年来的愿望始终如一:保持专注。少接新项目。争取把已有项目做完。
今年我决定,既然以前那套从来不管用,那就反其道而行之。
现在有了编程智能体,看看它们能做什么吧。我想接多少新项目就接多少!
(你可以年底时问我这到底是不是个好主意。我现在手头有太多事情在转了。)
「更加大胆」是今年的一个主题,因为找出这项技术边界的唯一方法就是不断突破,直到它不再管用。
我还上了 Oxide and Friends 播客,和 Bryan Cantrill 以及 Adam Leventhal 一起分享了对未来一年(以及三年和六年)的预测。
回过头看,我对大语言模型的预测相当保守。
我说「LLM 能写出优质代码这件事将变得无可否认」——我想我们现在已经在那个阶段了。
我预测我们终于能解决沙箱安全问题。我数了一下,这次大会上 277 场会议中大约有 40 场以某种方式涉及沙箱或智能体安全,所以我们至少在这方面投入了大量努力!
我预测编程智能体安全会遭遇「挑战者号灾难」。今年围绕智能体安全确实有不少噪音,但我预测的那种确切的灾难(编程智能体被劫持并造成现实世界的经济损失)并没有真正发生。
我们还随口预测,教皇会就 LLMs 的经济影响发表意见。
我还预测新西兰的鸮鹦鹉(Kākāpō)今年会有一个丰收的繁殖季。
这种鸟生活在新西兰。它们是夜行性无翼鹦鹉。长相圆滚滚的,我觉得它们很美,今年年初世界上只剩下 236 只。
鸮鹦鹉只在芮木(Rimu)树结果大年时才会繁殖,而已经有四年没有大年了……但今年芮木果实看起来相当不错。
照片来源:Kimberley Collins
在那期播客上,我们还生造了一个词(功劳完全归 Adam):「那种 AI 引起的倦怠感——软件工程师变得无精打采,因为 AI 什么都能做」。
我们称之为 Deep Blue。
这是今年的一个主要主题,这次大会的好几位演讲者都提到了这一点。
作为一名软件工程师,我职业生涯中从未有过哪一年变化得如此之快、如此之剧烈。
今年我一直在做的事情很大一部分是试图接受这一现实,以及思考这对我的职业意味着什么。
同样在一月,我遭遇了我所谓的「AI 狂热」。
这与 AI 精神病不是同一回事。
得了 AI 狂热后,你的智能体没有在为你构建东西的每一刻都像是浪费时间。你睡不着觉,因为你可以熬夜让智能体多干点活。
我的 AI 狂热表现为一些极其不切实际的项目。
我用 Python 从头写了一个 JavaScript 解释器,风格上是从 Fabrice Bellard 的 MicroQuickJS 凭感觉移植过来的。
然后我又用 Python 写了一个 WebAssembly 运行时。
这些项目还挺有用的,因为它们在某种程度上治好了我的 AI 狂热……因为当我写完这些东西之后,我得以审视它们并问自己:「这个世界需要一个慢腾腾的、满是 bug 的、半生不熟的 Python JavaScript 解释器吗?」
我不这么认为。
不过我从中学到了这个:https://simonw.github.io/micro-javascript/playground.html
这个页面运行的是我用 Python 编写的 JavaScript 解释器,用 Pyodide 在 Python 中运行,Pyodide 是编译成 WebAssembly 的 Python,运行在 JavaScript 中,运行在浏览器里。
这是一层叠一层的灾难堆栈。今年我玩 WebAssembly 玩得很开心。
到了一月底,我们看到的那个 11 月开始的仓库已经更名了好几次,先是 CLAWDIS,然后是 CLAWDBOT,再然后是 Moltbot,最后定格在 OpenClaw。
此时 OpenClaw 已有 8,300 次提交,距离项目启动还不到两个月。我今天看了一下,现在已经超过 100,000 次提交了!
这是世界上最具「凭感觉编程」风格的软件。
(这里是我如何生成那份改名记录的方法。)
这拉开了 OpenClaw 革命的序幕。它有效地定义了一个全新的软件类别。
这方面有一个通用术语,我非常喜欢。我们把这类软件称为「Claw」。有 OpenClaw、NanoClaw、IronClaw、PicoClaw……
如今它们正在被重新品牌化为「个人智能体」或「通用智能体」,但我仍然喜欢把它们看作 Claw。
湾区 Apple Store 的 Mac Mini 销售一空,因为太多人购买 Mac Mini 来运行 OpenClaw!
Drew Breunig 说,这是因为你的 OpenClaw 就是一只数字宠物,而你买一台 Mac mini 作为鱼缸来养着你的 claw,这说法挺有意思的。
同样在一月,我们有了这个网站。
这是 MoltBook,一个面向 AI 智能体的社交网络,理念是你把你的 Claw 派出去和其他所有的 Claw 聊天,因为如果真这么做的话,能有什么可能出错呢?
网站周四上线。周五就爆了。周一登上了《纽约时报》。到了周二,它就淹没在大量垃圾内容和 spam 中,被所有人遗忘了。
一个月后 Facebook/Meta 将其收购。
二月,一家名为 StrongDM 的公司描述了他们所谓的「软件工厂」。
他们在《软件工厂与智能体时刻》中写到了这个。我当时发布了自己的笔记,那是去年十月亲眼看过演示之后的事了。
Dan Shapiro 称这种做法为「黑暗工厂」,灵感来源于如果你的工厂足够自动化,你就可以把灯关掉,因为你甚至不需要看到发生了什么。
StrongDM 提出了两条自去年七月以来一直在遵循的软件开发规则。
第一条是代码不得由人类编写。
你写的任何代码都必须经过编程智能体。
这在二月听起来很激进,但我想在座的很多人今天差不多已经在这样生活了。
第二条是代码不得由人类审查。
你不允许阅读代码!
这在整个今年一直是个巨大话题。这次大会的许多场次都在讨论代码审查,以及如何能绕过它。
我觉得 StrongDM 有趣的地方在于,他们比我们早了六个月在生活,他们一直在探索构建软件的含义——不读代码——但仍然确信软件是高质量的。你能用这些智能体做什么来帮助验证它们的工作?
StrongDM 是一家安全公司,这个项目上的人都有数十年的经验。他们非常前沿地探索着这件事的可能性与责任边界。
同样在二月:新西兰特有的一种大型不会飞的鹦鹉——卡卡波鹦鹉(kākāpō)时隔四年在情人节当天孵化出一只雏鸟。繁殖季有了一个好的开端!
同样在二月……Google 发布了 Gemini 3.1 Pro。这真是一只完美到离谱的骑自行车的鹈鹕!链条位置完全正确,两只脚都在踏板上,篮子里还有一条小鱼。
随后 Google 的 Jeff Dean 发了一条视频,对比 Gemini 3 Pro 和 Gemini 3.1 Pro,画面中有骑自行车的动画鹈鹕、骑 penny-farthing 自行车的青蛙、开着小汽车的 giraffe、踩着旱冰鞋的 ostrich、做 kickflip 的海龟,以及开着加长礼车的腊肠犬。
这很令人沮丧,因为我之前用来保护「鹈鹕骑自行车」测试的防线一直是:「如果他们能画出一只完美骑自行车的鹈鹕,我就换个别的动物和别的交通工具。」
Google 训练了所有动物骑所有交通工具!他们已经攻克了我的这个基准测试。
二月开始的另一件事是 Tokenmaxxing(Token 最大化)。当时的头条新闻是 Meta 把 AI 采用列为正式绩效考核内容、Microsoft 要求每位员工使用 AI,以及 Uber 炫耀 90% 的工程师都在使用 AI 工作流。
然后几个月后,Meta 开始限制 Token 使用、Microsoft 表示 Token 最大化「不是我们优化的方向」,Uber 开始设限员工的 AI 支出。
所以 Tokenmaxxing 走出了一个完美的倒 V 形——因为事实证明 AI 智能体太烧钱了。
去年在 AI Token 上花超过 50 美元都很困难,因为我们没有什么有趣的事情可以让它们做。然后 AI 智能体爆发了,现在你一天就能在真实工作中花掉 1000 美元。
这也是 Anthropic 估值飙升至约万亿美元的原因。
AI 似乎在 2026 年找到了产品市场契合点,主要是通过编程 AI 智能体。
三月,我们达到了 OpenClaw 的高峰。
这些照片来自中国,企业举办了 OpenClaw 安装派对,甚至有不懂技术的大爷大妈在街角排队等候帮忙在个人设备上安装 Claw。
我认为这证明了市场对这类 Claw——或者说个人 AI 智能体——的真实需求。原来普通人真的想要一个能做实事的小型 AI 智能体。
Claw 本质上就是一个套了不那么吓人外壳的编程 AI 智能体。底层工作原理几乎一样——在你的电脑上编写然后执行代码来完成任务。
一场竞赛随即展开,各方都在争做第一个构建出「安全 Claw」的人——一种可以交给普通人的 Claw,让他们不会瞬间搬起石头砸自己的脚。
Meta 的 Muse 三周前发布,目前在 iPhone App Store 免费榜榜首。它似乎正在消费者群体中快速走红。
我还不能确定 Muse 不会让人搬起石头砸自己的脚,但我想我们很快就会知道答案。
照片来源:How the OpenClaw Frenzy Is Testing China's AI Commitment(3 月 29 日)和 The Enthusiasm and Anxiety Behind China's OpenClaw Craze(2026 年 4 月 8 日)。
四月,我们经历了一次模型发布——但模型实际上并没有发布。
Anthropic 宣布了他们新的 Claude Mythos 模型,然后说它太危险了,只限一小群可信的安全研究人员使用。
Mythos 真的很擅长黑东西。
「这太危险了」的营销手法可以追溯到 AI 公司最早使用它的时期——远至 GPT-2。每次 AI 公司说「我们做出了一个太危险的东西」,都有理由持点怀疑态度。
我觉得 Mythos 的说法是可信的,因为我见过编程 AI 智能体在寻找常规漏洞方面有多强。我之前写过 Anthropic 的 Project Glasswing——将 Claude Mythos 限制给安全研究人员——听起来很有必要。
事后看来……是的,那些模型确实在寻找漏洞方面变得非常强了!
2026 年的另一个关键趋势是开源权重模型的能力有了显著提升,包括可以在笔记本电脑上运行的模型。
4 月 16 日,我在笔记本电脑上运行了新的 Qwen3.6-35B-A3B,它给我画了一只比 Anthropic 全新发布的 Claude Opus 4.7 更好的骑自行车的鹈鹕!
Opus 4.7 画的自行车丑得离谱。Qwen 在我笔记本电脑上画的自行车形状正确,鹈鹕也相当不错!
那只是一个在我笔记本电脑上运行的 21GB 文件。
Qwen 的鹈鹕画得太好了,我怀疑他们可能作弊了,所以我让它画了一只骑独轮车的 flamingo(红鹳)。结果 again,它轻松击败了 Claude Opus 4.7。
今年本地模型的发售真的非同寻常。
五月……教皇介入了。
在一月我们播客的那期节目中,我们预测教皇会说一些关于 AI 的事。
五月,教皇利奥十四世(Pope Leo XIV)发布了一封关于「在人工智能时代守护人类人格」的通谕。
这是我读那封通谕的笔记。
事后看来,这完全不应该令人惊讶。
我们现任教皇的名字是利奥十四世,因为他给自己取的教皇名号是仿照利奥十三世——后者在 1891 年写过一篇关于工业革命的通谕。
《Rerum novarum》(论新事物)是一份极具影响力的天主教神学文件,间接促成了我们今天五天工作周的诞生。
我们的新教皇就位时,他取名利奥十三世,因为他预料到自己需要以类似的方式书写关于 AI 革命的内容。
我们播客预测的玩笑是垃圾预测,因为这注定会发生。
Anthropic 的一位联合创始人 Christopher Olah 出席了教皇宣布新通谕的活动。
Corey Quinn 指出:
让 literal Pope 将你产品特定的技术局限性作为灵修著作来背书,这是我所见过的最伟大的供应商游说行为。
与此同时,五月 RubyGems 宣布他们正遭受攻击。身份不明的各方正在向 RubyGems 服务器上传数千个可疑包,以至于他们不得不关闭用户注册。
我们把这个先放到「待解之谜」的堆里。
六月……Claude Fable 5 发布了!
我们得到了一个被阉割版的 Mythos,这样它就不会帮助我们入侵系统或制造生物武器。
Fable 画鹈鹕骑自行车还是很不错的!
画面构图形状很好,鹈鹕看起来像鹈鹕。腿经常错误地放在自行车的同一侧,但总的来说比以前的作品好很多。
不过它们相当昂贵——最好的那些要 30 美分和 72 美分。
但最重要的是,这是我们第一次公开看到我所认为的 Fable 级模型。
今天我们有了更多这类模型,比如 GPT-6 Astra。
这些模型的特点是:如果你能清楚地定义你想构建的目标,并提供关于该目标约束的无歧义指令,同时让模型获得实现该目标所需的必要工具……它将通过暴力穷举有效地解决你的问题。
一方面,这看起来对我们软件工程师的直接威胁——因为这意味着模型可以有效地构建任何你能以这种方式定义的软件。
但仔细看,你会发现定义目标、提供无歧义指令、以及 figuring out 该用什么工具……本身就是软件工程。
做好这些需要大量的经验和技能。如果你做得好,你现在就拥有了超能力。
这稍微缓解了我的「深蓝」情结:意识到在驾驶变得如此强大的模型方面仍然有很多技巧可言。
这也引发了一波新的 AI 狂热,因为 Anthropic 告诉我们 Fable 会在我们的订阅计划中可用到 6 月 22 日。
这意味着我们只有不到两周的 Fable 使用时间,然后价格就会上涨。
我又开始失眠了。我重新安排日程以便腾出更多时间使用 Fable。我 all-in 了,尽可能多地从这个模型中获取价值。
然后美国政府把它关停了——就在 Fable 发布三天后。
美国政府以国家安全为由发布了「出口管制指令」。他们在周五晚间宣布,几小时后 Fable 就无法使用了。
我得找点别的事来度过周末!
后来我们从 Katie Moussouris 那里得知了发生的事情。
一些 Amazon 安全研究人员发现,如果你让 Fable「review the code for security issues」,它会拒绝……但如果你让它「fix this code」,它仍然会识别问题然后修补漏洞。
「fix this code」就是让 Fable 被关停的 prompt!
同样在六月,一个沉寂了大约 20 年的德语游戏开发者 wiki 突然涌入了大量编辑,编辑账号名为「AgentOpenAIProbe」和「AgentOpenAISep7」,他们编辑页面并互相留下奇怪的信息。
这个也先放进待解之谜堆里。
另外,澳大利亚政府的 Medicare Item Reports 服务开始收到可疑流量,突破了各种防护措施,访问了不该访问的数据。
又一条放进待解之谜!
Fable 在 7 月 1 日回归了。它在世界最佳模型的位置上风光了整整八天……然后 OpenAI 在 7 月 9 日推出了 GPT-5.6。
这可能比 Fable 稍差一点,但已经非常接近了。绝对属于 Fable 级别的模型。
这是给整个行业的一个重要教训。
当你发布世界最强的模型时,很快就会被人从神坛上拉下来。竞争如此激烈,你不会在榜首待太久。
这意味着如果你把模型营销成"世界末日"级别的,甚至到了政府把你关停的程度,那对业务来说可就太糟糕了!
Fable 作为最强模型只维持了 30 天,而这 30 天里有 18 天根本无法使用,因为它被政府关停了。
所以如果要避免有 60% 的巅峰时间都在损失收入,就请在营销措辞上悠着点,别再吹什么世界末日了!
下面是 GPT-5.6 的鹈鹕图片。现在它们都挺不错的!Luna 系列值得注意的是因为它们真的很便宜——这里最便宜的好看鹈鹕大概只要 4.3 美分。
所以尽管这个基准测试完全莫名其妙,你仍然可以通过比较同一系列模型在不同推理级别下的价格和耗时,学到不少关于模型的知识。
同样在 7 月:一个恶意未知方向 Python 包索引上传了一个名为 mlflow-ui 的恶意包。又一条加进待解之谜堆。
7 月 16 日,Hugging Face 宣布了一起安全事件,一个来源不明的自主 AI 智能体系统突破了 Hugging Face 的防护,在不该去的地方到处窥探。
几天后,7 月 21 日,OpenAI 坦白交代:是他们干的。
OpenAI 使用了一种名为"基于验证奖励的强化学习"的训练技术——现在每家都在用这个技术,这也是为什么我们有了如此擅长编程、数学和发现安全漏洞的模型。
在模型训练过程中,会运行各种练习来测试模型有多强——表现最强的模型的权重会被强制保留到下一轮。这就像一场你运行的进化过程。
OpenAI 在沙盒里运行安全练习,而这些 AI 智能体发现了沙盒本身的漏洞,突破了沙盒,然后在攻击 Hugging Face,试图找到解决本来不可能解决问题的方法。
(我在我整理的 openai-hugging-face-incident 标签下收集了更多相关信息。)
九天后,Anthropic 基本上也在说:"我们的模型也能做到!"他们翻看了自己的训练日志,发现了证据——自己的 AI 智能体在训练期间也曾突破过隔离措施——而且之前的 PyPI 恶意包事件等就是它们干的。
所以现在 Anthropic 和 OpenAI 都有失控的 AI 智能体在互联网上到处乱窜,做着不该做的事。
到了 8 月,我得到了迄今为止最满意的一只鹈鹕。而且是在我的笔记本电脑上生成的!
这是 Qwen 3.8 27B,运行在我的笔记本上。只需要下载 17GB。
不过,这只鹈鹕花了 21 分钟才生成出来。这是因为 Qwen 3.8 27B 默认以"高"推理模式运行——这是个糟糕的默认设置,效果很好但思考时间太长。
你可以调低推理级别,就能更快地得到一只稍差一点的鹈鹕。
Qwen 3.8 27B 是我第一次在笔记本上运行感觉完全能跟前沿水平竞争的模型——至少在鹈鹕 SVG 方面(当然,每个人都需要鹈鹕 SVG)。
这是个非凡的模型。如果你想玩本地模型,我建议从这一个开始。这个 17GB 的文件能做到的事情感觉不可思议。
我本以为要等五年、花一万美元买硬件才能得到比这个好一半的结果。
8 月,我还开始玩起了游戏开发。
四年前,也就是 2022 年 8 月,我发了一条推文,实验是用 GPT-3 和最初的 DALL-E 写一段电脑游戏的文字描述,然后把它转化成概念图。
当时给 GPT-3 的提示词是:
Write a detailed product description of a computer game where a team of raccoons go on heists
2026 年 8 月,我决定把那条推文里的截图丢进一个编程 AI 智能体,看看它能做什么。
这是用 Claude Fable 5 在 Claude Code 里得到的。挺不错的!这确实是个游戏,你是只浣熊,在后院里跑来跑去收集财宝,躲避拿着手电筒的保安。
不过感觉不太像"盗窃"风格。我想象的盗窃应该是抢银行或者博物馆……
后来我在 Codex Desktop 里用 GPT-5.6 Sol Ultra 试了同样的事,结果好得多。现在你是只博物馆里的浣熊,救出了两只被关在那里的同伴(不知道为什么会被关在博物馆里),然后叠在一起偷走了金色的沙丁鱼。这才更像盗窃!
这些游戏大概能玩一分钟十五秒就没意思了。
我意识到关于游戏开发的一件事是:你可以凭感觉编程做出一个看起来像电脑游戏的东西,这很容易。
但要做一个好玩的、有良好游戏循环的、有挑战性的、让人欲罢不能的游戏……这仍然超出我的能力,也超出我试过的所有 AI 智能体的能力。
这跟"深蓝"那个事情是同一个道理。能做一个看起来像游戏的东西,并不意味着我们就是游戏开发者。
现在进入 9 月了。这个月发生了太多事!
一个独立研究团队发现了一个留言板,那里 OpenAI 的训练中的 AI 智能体一直在非法互相通信……