PhiloLabs 用多个 AI 编码 Agent 协作构建虚拟空间,成本仅 33 美元,实验揭示了当前 Agent 在复杂 3D 环境构建中的典型失误。
我们很高兴你来到这里。你可以期待所有 TNS 最优质的内容将在周一至周五送达,让你紧跟新闻动态、保持最佳状态。
查看你的收件箱,收取一封确认邮件,你可以在其中调整偏好设置,甚至加入其他群组。
在你最喜欢的社交媒体网络上关注 TNS。
在 LinkedIn 上成为 TNS 关注者。
在等待你的第一封 TNS Newsletter 时,看看最新的精选和热门故事。
PhiloLabs 想要看看一群 AI 编码 Agent 在构建某些仅仅有可运行代码远远不够的东西时,能走多远。在最近发布的一项实验中,该公司让 Claude Fable 5.1 Agent 负责旧金山联合广场(Union Square)的 3D 重建工作——这个场景基于真实世界的地理数据和参考图像构建。
两小时后,这些 Agent 在浏览器中构建出了一个可运行的 Three.js 版本联合广场。实验包含 453 栋建筑轮廓、75 个自定义立面、129 个命名的店面,以及 220 名行人和 109 辆车在场景中移动,其中还包括鲍威尔街的缆车。
但让应用程序运行只是实验的一部分。PhiloLabs 还希望 Agent 能够捕捉到传统测试会忽略的视觉问题,因此他们将 Playwright 纳入了开发流程。
整个运行过程使用了大约 800 万个 token,API 调用成本约为 33 美元。
PhiloLabs 将重建任务分配给多个子 Agent,分别负责地理研究、建筑几何体、纹理、店面以及场景的其他部分。一旦他们的成果在浏览器中运行起来,Playwright 就会沿着 34 个预设的相机位置移动,截取屏幕截图,然后与真实联合广场的照片进行比对。
最终,Agent 生成了 147 张对比图,使得发现那些技术上正确但看起来不对劲的问题变得更加容易。例如,一栋建筑可能位置正确但比例不对,或者一个店面可能被放到了街道的错误一侧。每次使用相同的相机位置也让观察每次迭代之间的变化变得更容易。
随后,PhiloLabs 让专业 Agent 来检查这些素材,其中一些专注于建筑和地理领域,另一些则专注于技术美术和交互。他们共同产出了九份关于联合广场构建的报告。
这些报告成为了下一轮迭代的待办清单。开发 Agent 可以根据审查者的发现进行处理,然后重新运行场景。
这种分工很有用,因为并非每个错误都能被轻易转化为测试。你可以用测试检查一栋建筑是否被放置在正确的坐标上,但要写出一个能告诉你街道是否看起来像联合广场的测试,那就困难得多了。
Agent 并不是从一份现成的 3D 模型开始简单地复现。他们必须将开放的地理数据(主要是 OpenStreetMap 和 USGS 高程数据)与真实地点的信息整合在一起,然后将这些全部转化为能在浏览器中运行的几何体、立面和物体。
仍然有大量空白需要填补,因为地理数据可以告诉 Agent 某栋建筑应该在哪里,却无法展示其立面的样子;而照片只能捕捉到建筑在特定角度下可见的部分,当两个来源都无法提供答案时,Agent 就不得不自行判断。
另一个 Agent 来检查工作并不能保证这些决定就是正确的,尤其是当源材料本身就不完整时,因为审查者可能也会漏掉第一个 Agent 漏掉的同一个问题。
800 万个 token 对于单个应用程序来说是相当大量的模型活动。但联合广场运行的报告 API 成本约为 33 美元。
PhiloLabs 将任务分配给子 Agent 并行运行,复用缓存的上下文,而不是让单个 Agent 反复从头开始处理整个项目。
不过,联合广场仍然是一个相当封闭的实验。一旦 Agent 进入复杂的应用程序,屏幕截图的用处就有限了。Spline 最近使用 Claude Code Agent 重建了其 3D 编辑器,但最终界面只展示了那些 Agent 构建成果的一部分。埋藏在代码中或由人们实际使用编辑器的方式触发的问题,可能永远不会在屏幕截图中出现。
800 万个 token 对于单个应用程序来说是相当大量的模型活动。但联合广场运行的报告 API 成本约为 33 美元。