前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8614
  • VS Code与Cursor接入IDEA语言能力
  • 用可复现基准筛选AI编程模型
  • 用40行测试复现Agent越权调用
  • 为Agent工具链注入故障并接入CI
  • 先构建只读Agent再开放写权限
  • 用微型聊天机器人测试指令边界
  • 用大模型把每日日志变成故障摘要
  • 可替换的文档问答检索架构
  • 用 dsctl 自动化管理 DolphinScheduler
  • TONTOU 绕过 Spectre v2 防护
  • Apple 芯片本地跑模型:MLX 对比 llama.cpp
  • AI Agent 入侵暴露凭证复用风险
  • 百万Token让模型生成三维世界
  • 用证据排序缓解RAG位置偏差
  • AI写Rust通过编译后还要审什么
  • 分清Claude Code的上下文与记忆
  • 模型切换时保护分类数据语义
  • 下一代 Qwen 或对大客户按营收抽成
  • OpenAI 发布智能体插件开放规范
  • 生产级 LLM Agent 避坑实战
  • 卡帕西力推指环王成为大模型评测基准
  • 更换大模型前先测真实业务负载
  • GitHub Copilot企业可管控MCP服务器白名单
  • 阮一峰:国家为何需要开源软件
  • 低成本弹性部署多模态推理服务
  • AI 批量造站为何几乎赚不到钱
  • 用模型路由层降低供应商锁定
  • Bot 检测应转向代理授权验证
  • AI 应用生产化的成本与扩容指南
  • DeepSeek V4 Flash 基准与架构核验
  • 多模型路由的生产级设计思路
  • 英伟达开源 GPU 直连存储栈
  • Vercel Sandbox:给每个编程Agent独立隔离环境
  • MCP服务上线前的验证清单
  • AI代理越权操作真实网络资源
  • 五类工业数据流的统一建模
  • ChatGPT 默认升级 GPT-5.6 系列
  • 每月十英镑以内运行 SaaS 后端
  • 融合物联网信号构建反欺诈管道
  • GPT-5.6 Sol 统一 ChatGPT 推理模式
  • MCP Workbench 开放免费测试版
  • AI 生成项目上线前的五维审计
  • 让 LLM 链路追踪真正可排障
  • 用 Playwright Trace 定位 CI 测试故障
  • 用证据门禁约束多Agent开发
  • 从7%召回率迭代漏洞扫描器
  • 深入拆解vLLM高吞吐推理架构
  • 端侧AI交易钱包的安全架构
  • 如何验证负责验收模型输出的模型
  • GPT-5.6 Sol 增强复杂推理与工具调用
  • Qwen3.8 Max登顶智能体榜单
  • 已加载 51 / 8614
8.0
热点
AI SCORE
技术实践2026-08-07 09:15

卡帕西力推指环王成为大模型评测基准

量子位#AI评测#Karpathy#大模型
Editor brief · 编辑速览

Andrej Karpathy建议用《指环王》文本评测大模型长文本理解和推理能力。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

就在刚刚,大神卡帕西(Andrej Karpathy)宣布,"我们"Anthropic 已经开始用一种全新的方式,给大模型上强度——

据卡帕西介绍,这套"指环王基准"(Lord of the Rings Benchmark),正在接替过去风靡一时的"鹈鹕骑自行车"(Pelican on a Bike)SVG 测试。

具体来说,卡帕西直接把《指环王》的开篇文字丢给 Opus 5,让模型用 Three.js 现场生成一整个"中土世界"。

至于最终效果嘛,多少有点像上世纪 90 年代末、21 世纪初的国产 3D 动画片:很粗糙,也很抽象。

但客观来说,仔细看上一会儿,如果你又恰好熟悉坐落在新西兰的《指环王》取景地霍比屯(Hobbiton),倒也确实能看出那么一丝味道。

不过,就是这么个看起来不太精致的玩意儿,却实打实地花掉了 Opus 5:100 万 token、2 个小时以及 5500 行代码。

当然,舞台上并非只有 Claude Opus 独自美丽。

最搞笑的,还得是网友新端上来的一碗 DeepSeek V4 Flash 版本——直接一整个"中国人能飞",画面人物全员漂浮。

面对这些目前肉眼可见的穿帮,卡帕西倒也相当中肯。他指出,Opus 5 目前还无法真正"进入"自己生成的世界,只能在不同时间点不断截图,再慢慢检查哪里出了问题。它们已经能写代码、搭场景、生成游戏,却还不能真正看懂视频,也不会亲自玩一遍自己做出来的游戏。


咱们先来看这个"指环王"测试具体是怎么做的。

如果按照卡帕西推文的字面意思,这次输入给 Opus 5 的主要提示词,应该就是《指环王》正文第一章《期待已久的宴会》(A Long-Expected Party)的开篇:

袋底洞的比尔博·巴金斯宣布要举办盛大的 111 岁生日宴会,霍比屯立刻议论纷纷……

除此之外,卡帕西还在提示词里指定了 Three.js——也就是一个用代码搭建 3D 场景的 JavaScript 库。

由此,Opus 5 要完成的任务,就是先读懂《指环王》开头的文字,再把它翻译成一个能够在浏览器中实时运行的 3D 世界。

整个过程中,Opus 5 需要用多边形拼出人物、建筑和道具,把它们逐个放进 x、y、z 坐标系,再安排好摄像机、灯光和动画。人物什么时候移动、镜头往哪里转、灯光如何变化、场景中的物体又该如何互动——全部需要模型用代码定义。

虽然最后的画面称不上精致,而且经常出现穿模、漂浮等问题,比如人物的身体和脑袋分离……但整套场景好歹被真正搭了起来。

需要注意的是,这和视频模型直接生成一帧帧像素并不是一回事。Three.js 需要先把人物、物体和场景作为三维对象建立起来,再根据代码实时计算它们的位置、角度和运动状态。所以,我们看到的 Demo 并不是一段普通的 AI 生成视频,而是一个 3D 网页场景运行时的录屏。

不过,卡帕西在评论区也提到,程序化 3D 和视频生成并不是二选一。有网友提议,可以把这个粗糙的 Three.js 录屏交给 Seedance 充当参考视频,再让视频模型用更高的画质重新渲染一遍。按照他的设想,程序化代码可以负责分镜和控制,先把人物站在哪里、镜头怎么运动、剧情如何推进这些骨架敲定;接下来再把录屏交给 Video-to-Video 模型,让它补上纹理、光影和细节,把整个中土世界的"卖相"拉满。

至于音频,Opus 5 这次倒没有一起包圆。卡帕西表示,出于个人对音质的要求,最终使用的是 ElevenLabs。

于是,开头那段有画面、有镜头、还有旁白的《指环王》Demo,就这么横空出世了。卡帕西也已经将整个项目开源,具体链接可以参考文末。


就在卡帕西放出 Demo 后,不少网友也赶来测试了一番。

有人用 Claude 启动了一个「Earth Online」项目,目标是靠一群 AI Agent,把整个地球一点点搭出来。目前,Agent 还没造完整个地球,只搭出了一个低多边形(Low-Poly)风格的旧金山滨水区。但从现有画面来看,建筑比例、人物尺度和整体风格都保持得相当统一。这个效果有点像那种乐高世界的动画片——画风不复杂,但人物、场景和动作能在同一个世界里稳定运行。照这个方向继续走,简单画风的动画和轻量游戏,已经有了点 AI 原生的雏形。

还有网友用 Fable 5 和 GPT-5.6 Sonnet 搭出了纽约市的 3D 数字模型,并在其中接入实时数据。模型不仅要把纽约的街道和建筑摆对,还要维持不同区域之间的空间关系。作者也因此提出,这种生成虚拟世界的任务,或许可以成为一种新的空间推理 Benchmark(Spatial Reasoning Benchmark)。

有网友没买到 Kanye West 的演唱会门票,干脆用 AI 在浏览器里给自己补办了一场。整个项目依旧由 Three.js 搭建——只有一个 HTML 文件,没有调用任何现成的 3D 模型,舞台、人物和灯光全部由代码生成。整场演唱会一共准备了 14 首歌,每首歌都有独立的灯光设计和一套专属的球形舞台视觉。普通用户可以试听片段,连接 Spotify Premium 后,还能播放完整曲目和整场演出。没抢到票,直接给自己生成一个包场,太亏贼了!

卡帕西在原帖末尾还畅想,后续可以给这些 3D 世界加入玩法,让玩家以旁观者、NPC 甚至故事角色的身份进入其中。结果游戏版本还没等卡帕西安排,网友已经做出来了——这个项目同样使用 Opus 5 和 Three.js,不仅能运行和交互,连音频都配上了。

更多 3D 设计案例也在不断出现。从建筑比例、空间布局到场景风格,Opus 5 已经能在规模不小的项目里维持相对稳定的一致性。

客观来讲,这些作品距离真正成熟的游戏仍有距离。眼花缭乱的玩法是否有趣、长时间运行是否稳定、玩家会不会真的愿意在里面待上 15 分钟,目前都还没有答案。但实时 3D 内容和可玩原型(Playable Prototype)的制作门槛,确实被向下推了一大截。更何况,能有一种新的方法测试模型能力,同时又足够有趣、好玩,岂不美哉?


那么,为啥突然要让大模型生成《指环王》呢?

这还得从前几年爆火的"鹈鹕骑自行车"测试说起。

这道题最早来自开发者 Simon Willison,要求只有一句话:生成一只鹈鹕骑在自行车上的 SVG 图片。

虽然这题目看起来简单,但其实它相当考验模型。因为 SVG 看起来是一张图片,底层却是一串代码。模型不仅要知道鹈鹕和自行车分别长什么样,还得把它们拆成线条、圆形和多边形,再用坐标安排好每个部件的位置关系。

更关键的是,鹈鹕和自行车本身就不怎么般配。自行车的车架、轮胎和踏板必须保持正确的几何结构;鹈鹕则长着大嘴、短腿,以及一副怎么看都不像会蹬车的身材。两者一组合,模型到底有没有理解空间关系,几乎一眼就能看出来:轮子歪没歪、脚踩没踩到踏板、鸟到底是在骑车,还是被车架当场肢解。

正因如此,"鹈鹕骑自行车"一度成了民间观察大模型空间理解、物体组合和代码生成能力的经典测试。

但随着模型越来越强,这只鹈鹕也快骑到头了。看看下面 DeepSeek R1 和 DeepSeek V4 的表现就知道,如今的模型已经能把这道题完成得相当像样。

更重要的是,一张 SVG 只能考察模型的一次性输出。它测不出模型能不能规划一个复杂项目、连续工作几个小时,并在几千行代码里反复检查和修正自己的错误。

于是,卡帕西把一道"画张图"的小题,换成了"搭个世界"的大工程。


很快,卡帕西准备给"鹈鹕测试"换题的消息,也传到了各大社区。

Hacker News 的高赞评论认为,虽然这些 Demo 的画面质量都很一般,但这恰恰说明,我们需要一个比生成单张图片更难的新测试。新的基准不该只看模型能不能把图画对,还要考察它能不能理解一个世界。模型不断针对这类任务刷榜,彼此之间的差距越来越难看出来。相比之下,生成一个完整的 3D 世界,需要模型理解人物和物体之间的空间关系,处理镜头、动作和场景变化,而不是简单调用视频生成模型吐出一段画面。

与此同时,鹈鹕测试也有其优势:足够简洁,成本低,结果也容易比较。为了测一次模型,消耗那么多 Token 生成整个 3D 世界,多少有点拿算力放烟花的意思。

与此同时,Three.js 本身能不能衡量大模型的综合能力,也遭到了质疑。有人认为,这类 Demo 最多只能证明 Anthropic 在 Three.js 代码上训练得不错,不能说明模型真的理解了空间和物理世界。

把一段抽象、含义模糊的文学文本转化成 3D 动画,模型需要同时处理空间关系、物理规律、日常物体,以及 3D 变换和计算机图形学中的数学问题。如果这还只能算"会写 Three.js",多少有点低估这 5500 行代码了。

所谓"空间推理",真的和大模型平时处理文字、代码时的推理不同吗?

一种观点认为,画面能否成立,取决于模型是否理解"前后、内外、远近、遮挡"等空间关系,以及物体在不同视角下的距离、角度和相对大小。

但另一种观点认为,无论模型处理的是"石头旁边",还是"数组里面",做的可能都是同一件事:根据上下文逐个生成 Token,并在这个过程中完成推理。

如果是这样,那么,Opus 5 展示的就不只是一项突然冒出来的"空间能力"。更可能的情况是,大语言模型(LLM)原本用于理解文字和代码的通用推理能力,已经开始自然延伸到三维世界。


从画一只鹈鹕,到搭出一个中土世界,题目看起来变了,但背后测试的或许始终是同一个问题:

模型能不能把自己对世界的理解,转化成一套真正能够运行的结构。

如果通用大模型已经能够自己写代码搭建 3D 世界,再调用 Seedance、ElevenLabs 等 API 完成画面和声音,那么用户还有多少必要,亲自打开一个专门的视频生成产品输入 Prompt?

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
生产级 LLM Agent 避坑实战
下一篇
更换大模型前先测真实业务负载