实验让 LLM 根据《指环王》开篇持续工作约两小时,生成约5500行程序化三维场景代码,成本约10美元。成品虽粗糙,却展示了长上下文模型规划空间结构并完成大型代码任务的能力边界。
AI 圈里一直流传着一个名为「鹈鹕测试」(pelican test)的 benchmark:让模型绘制一幅「鹈鹕骑自行车」的 SVG。它虽然是个玩笑,却很实用——可以快速判断模型究竟能够组合空间概念,还是只会进行模式匹配。Andrej Karpathy 认为,我们正在告别那个阶段。他最近进行的一项实验本周登上了 Hacker News 榜首,并用另一种鸟证明了这一点。
这一次,他没有让模型生成一幅 SVG,而是把《指环王》的开篇段落交给一个 LLM,同时给它一百万 token 的预算(约 10 美元),以及一条 prompt:将这段文字渲染成一个 3D 场景。模型工作了大约两个小时,编写出 5,500 行代码,以程序化方式生成故事中的世界——在 (x, y, z) 坐标中放置几何体、编排各种资产,并为所有内容添加动画。下面是未经修饰的原始输出,连同其中那些不够流畅和粗糙的地方一起呈现:
在 blog.koardy.com 上观看视频
视频:Andrej Karpathy 的原始帖子。整个世界均由模型以程序化方式生成——没有任何一个多边形是由人类放置的。
它确实有些粗糙,但也确实令人惊叹。不是因为最终结果有多精致——它并不精致——而是因为这样的任务如今居然已经成为可能。一个模型在两个小时里始终维持着一套空间规划,协调数千个运动部件,最终生成了一个连贯且可供探索的场景。一年前,那只鹈鹕甚至还很难稳稳地待在自行车上。
Karpathy 最犀利的观察并不是关于能力,而是关于成本:
任何头脑正常的人都不会愿意花时间去编写如此定制化的东西,但 LLM 拥有无穷无尽的耐力和耐心。因此,这就是一个从「根本不会有人做这种事」转变为「当然可以,为什么不呢,反正几乎免费」的例子。
这段话值得读两遍,因为它描述的并不是一次改进,而是一次类别层面的变化。大多数有关 AI 进步的报道,都聚焦于质量边界:更好的代码、更好的图像、更高的 benchmark 成绩。但另一条边界得到的关注要少得多——可行性边界。许多类别的工作一直没有发生,并不是因为它们无法完成,而是因为没人能够证明投入那些时间是值得的。例如,为小说中的一个段落制作专属可视化、开发一个一次性的内部工具,或者快速做出一个用完即弃的原型,以解决会议中的一场争论。
当定制工作的边际成本降低到 10 美元,以及两个小时无人值守的运行时间时,那些「不值得做」的积压项目,就会变成一片「为什么不做」的新边界。Karpathy 将这个想法进一步延伸到游戏领域:按需生成高度定制化的世界,让玩家可以直接进入其中——无论你能描述出什么,都可以得到一个转瞬即逝的 GTA。这个设想仍带有推测性质,但它在电子表格层面的版本并非如此:任何团队只要手上有一份由小型、定制化且从未获得优先级的开发项目组成的清单,现在都应该重新评估这份清单的成本。
这次演示也暴露出一个弱点,Karpathy 对此直言不讳:模型无法审查自己的工作。它原生不具备观看视频或亲自体验自己所构建游戏的能力。为了进行自检,它只能隔一段时间截取一次屏幕截图,整个过程既缓慢又笨拙,而且仍然会遗漏问题。这正是那些粗糙之处的来源。
这是工程团队应该认真思考的细节。生成能力正在复利式增长,验证能力却仍然落后。模型生成一个世界的速度,比它观察这个世界的速度还要快。
我们每天都能在代码生成中看到这种现象的小规模版本。模型可以在几秒钟内写出 diff,而真正昂贵且不可替代的步骤,是由人类(或测试套件)检查结果并指出:还是不太对,把第三十帧的摄像机角度修正一下。如果审查过程缓慢、模糊或分散在各处,那么生成速度再快也毫无意义。你只是在以更快的速度堆积未经审查的产出。
Karpathy 那次持续两小时的运行需要依靠屏幕截图和耐心。你的团队由 AI 生成的代码、文案和设计也同样需要这些,只不过应该以结构化的形式存在:需要有一个地方,让产物、针对产物的反馈,以及与产物有关的决策共同存在。这正是我们打造 Kahoona 时所押注的方向——把任务、commit、PR 以及围绕它们展开的审查对话集中在同一个界面中,让「已生成」与「已批准」之间的反馈闭环始终保持紧密,而不是消散在一条条聊天线程里。👉 查看其工作方式
我们认为有三点。
第一,鹈鹕测试正在退出历史舞台。简单的组合能力 benchmark 已经无法再有效区分不同模型。如今真正有意思的评估,更接近 Karpathy 的这次实验:需要较长执行周期,涉及多个文件,在空间或逻辑上保持连贯,并拥有真实预算的项目。
第二,重新评估你的积压项目。正确的问题不再是「模型能把这件事做好吗?」,而应该是「有哪些东西我们一直没有构建,只因为人类根本不愿意花时间去做?」其中一些项目现在几乎可以免费完成。
第三,不要只为生成分配预算,也要为审查分配预算。模型的盲点在于,它无法轻易感知自己的输出;如果反馈无处安放,这同样也会成为你团队的盲点。花 10 美元完成生成,只有在发现并修正那些粗糙问题同样廉价时,才算真正便宜。
那只鹈鹕从自行车上下来了,花 10 美元造出了一个很粗糙的中土世界。接下来的制约因素,已经不再是模型能够创造什么,而是你的工作流能否跟上它们的创造速度。
相关内容:AI 视频刚刚达到 30 秒,瓶颈也随之转移
相关内容:无需开会即可审查 Pull Request
如需采取进一步行动,你可以考虑屏蔽此人和/或举报滥用行为。