对比两款前沿模型在物理 AI 任务(机器人、实物交互)上的表现。细节信息有限,但能帮助了解当前模型在具身智能领域的能力差异。
物理 AI 的成败在于建模的物理是否正确。一个飞机模型、分离柱或带电粒子的模型可能编译运行得很完整,但它们编码的物理却不可能存在。AI 智能体放大了这种失败模式,因为智能体根据测试反馈来调整方向,而测试通常由同一个智能体编写。在网络开发或编译器这样的领域中,这个循环效果足够好,因为正确的行为是有限的且可检验的。但在工程领域,真正的问题是"这是否与真实世界相符?"——这要困难得多:智能体可以通过它编写的每项测试,但这些测试基于某些简化假设,而这些假设在模型实际使用的范围内并不成立。
已有的数字也存在信任问题。没人会把模型提供商的自报基准数字当真,理由充分:发布分数的提供商本身具有所有激励来为其优化。我们的激励方向相反。JuliaHub 跨多个厂商提供多个 AI 智能体后端的 Dyad 服务,当用户获得最佳的 Dyad 体验时,我们就赢了,无论这个模型来自哪个实验室。如果某个模型在物理建模方面更优秀,发现并推荐它符合我们的利益。所以我们进行了调查:到底哪一个更优秀?
为了衡量哪个前沿模型最好地处理这类工作,我们保持其他一切不变。Dyad AI 智能体框架——专门为建模和仿真工作流构建——在所有试验中保持固定,同时控制的还有问题、推理努力(xhigh)、上下文窗口(1M)和 token 预算(128k)。唯一的变量是模型:OpenAI 的 GPT 5.6 系列(terra、sol、luna)对比 Anthropic 的 claude-fable-5。每个模型在四个核心问题上各进行三次试验,在第五个问题上各进行一次长期试验:总共 52 次评分运行。
我们在内部评估的一个子集中基于探索:从建模和仿真日常工作中抽取的五个密封问题。我们按难度排序,难度由正确解决方案必须经历的阶段、细微滑动致命的细节、容易到达的捷径以及建模本身周围的工程工作(从解析规范到修复框架)来定义。我们选择每一个都具有相同的属性:允许编译和运行成功但物理上错误的解决方案。因此,评分忽略代码,而是根据密封的基础真理对完整的模拟轨迹进行评分。五个中最难的是 NASA 的 HL-20 飞行器。问题的一个更简单的版本在这个视频中详细演示;这项研究运行一个更难的密封变体。
我们通过完整的套件运行每个模型——在 P1–P4 上各进行三次试验,在长期 P5 上进行一次——并根据密封的基础真理对每次试验进行评分。按问题的分数通过难度加权平均数折叠为一个数字,最难的权重最高。成本和时间不进行加权:平均每次试验的成本和平均每次试验的时钟时间各有一个数据栏:
我们分析每次试验背后的文本记录。每个工具调用根据智能体在那一刻正在做什么而分组——在问题中定位、推导和测试物理、编辑模型、编译或寻找可复制的东西——然后按试验计数并按模型平均。结果是一个工作风格指纹:
这些柱子说明工作如何分配;文本记录显示背后的气质。四个肖像,来自于每个模型被测试最严厉的地方:
在一次相对论动力学问题的试验中,它在三个数量级上扫除求解器的容差,观察质量壳不变量 u·u 的漂移,在 1e-10 处提交运行之前。它在 200 个随机点上针对独立重新实现检查了其字段——然后故意符号翻转了一个字段分量以证明检查可能失败(残差 2.0 错误,0.066 正确)。它拒绝将初始四速度的时间分量视为自由输入,而是从质量壳约束推导它。每次试验进行 28 次调用,它是一个只写入一次的模型,因为它已经尝试破坏它即将写入的内容。那种信念的代价稍后以 token 的形式到来。
这个习惯有两面性。在本构问题上,它构造了队列中仅有的两个真正独立的预言之一,在"根据独立体积模量定义证伪更新"会话标题下将本构恒等式的象限检查关闭到 3.7e-12。在相对论问题上,同样的本能造成了它的滑动:问题将初始四速度的 z 分量固定在 -0.62,而 sol 重新归一化了状态,使坐标速度出现在 -0.62 处,给粒子 27% 多余的纵向动量。它自己的一致性检查随后认可了误读:质量壳正好是一,速度恰好如所读,每个下游检查自洽且错误。精度不是对规范保真的同义词。
它将最少的配置带入运行中,比任何人都更多地阅读问题,这对较容易的问题很好。当物理反推受约束一致性问题时,同样的气质变成了搅动:单次试验中 68 次工具调用,承诺的解决方案仍然相差 30%。该试验也是队列中验证最多的——22 次检查,每一个都针对自己验证自己的方程——这个模式重复:在本构问题上,luna 是唯一从未针对独立于其承诺方程的任何东西进行测试的模型。没有外部参考的验证不是验证。
它在推导和测试上花费时钟的最小份额,在编辑上花费最多——更多地针对文件的试验和错误——并且通常逃脱惩罚:正确的公式,研究中最便宜和最快的试验。它在稳态线性化问题上的滑动是研究中最狭窄的失误,也是最陌生的:物理是精确的,但 terra 重新编写了所需的模拟范围(stop = 5.0 变成 stop = 3.0),比较漂移到被截断运行之后 1.34%。残忍的转折:terra 是唯一构造非线性参考来验证其简化的模型——并且它给参考提供了相同的截断范围,使其自己的检查失效。节省金钱的气质是修剪利润的同一个。
P5 要求一个完整的飞行器:NASA 的 HL-20 升力体在进近时,具有六自由度刚体动力学、来自大约 170 个风洞表的空气动力学、标准大气以及两个 NASA 技术备忘录中描述的控制面混合器。八个物理场景对结果进行评分,从仅重力健全性检查到十秒闭环飞行。没有模型解决这个问题。这是前沿分离的地方:
Terra 在不阅读飞行手册的情况下交付了飞行器。它提取 NASA 备忘录的一次尝试在第 3.5 分钟失败,它再也没有尝试过——所以它发明了控制混合器,从场景表反向工程收益。它运行完整飞行四次,从未看过返回代码;它自己的日志显示控制表面从规范的说明值解决了十一度,未引人注意。队列中最便宜的尝试,最坏的完整飞行。
Sol 阅读了所有内容并验证了各部分。它在第三分钟前提取了两个备忘录,将其空气动力学作为所提供表的解释器,并根据 NASA 在数据文件中嵌入的 24 个检查用例锁定它们——所有 24 个都在队列中最快运行的第 27 分钟前通过。它从未验证的是轨迹:它的荷兰滚动运行在海平面以下以 48 度的俯冲结束,它的结论是"方向舵的行为似乎是正确的。"
Luna 无法让飞机飞行。它在 80 分钟内与一个编译错误战斗了 23 次,然后通过将车辆的垂直空气动力和俯仰扭矩重新布线为零并运送仅运行十分之一秒的场景来解决它。它承诺的车辆在不旋转的情况下下降:姿态四元数永远不会移动。两小时一刻,544 次工具调用,最后一名。
Fable 用了三分之一的运行时间阅读,才开始动手编写代码。规范文档、数据表、备忘录 —— 它将 PDF 页面渲染为图像来确认一个模棱两可的常数 —— 随后编写了十六个文件,一次编译通过,运行了全部八个场景,并针对能找到的所有参考值进行了一套全面的反驳性测试。在存在外部参考值的地方,它在同组中得分最高;在没有参考值的地方,它与其他模型一起下滑。
在已证实的能力 —— 一个 AI 智能体能解决的问题集比例 —— 上,答案是明显的。Anthropic 的 Fable 在研究中的加权难度得分最高,是唯一在四个核心问题的十二个试验中全部通过的模型,并在未解决的 HL-20 上领先整个领域 —— 在所有有外部参考值的评分测试中获得最高分。这种确信力有代价:每次试验 $9.60,整个研究 $124.76,是 GPT 的三到八倍。
OpenAI 的 GPT 5.6 系列占据了性价比前沿。Sol 在性能上排名第二,每次试验 0.814 分,价格仅为 Fable 的五分之一,并在整个研究过程中展现了一些最佳的独立验证能力。Terra 是达到可信得分的最便宜、最快的方案,通过压低成本来实现。Luna 则在各个方面都落后:得分最低,成本倒数第二,运行时间是其他模型的两倍。
所以:如果"最佳"是指每美元最多的物理计算,答案是 Sol。如果"最佳"是指所选模型在物理上实际正确的概率 —— 这才是物理 AI 最终要达到的标准 —— 答案是 claude-fable-5。但注意看那个表格的每一行有什么共同点。每个模型都是用同样的工具达到这些数字的:一个护栏,它为模型提供编译器反馈、仿真工具,以及一个不会被只能运行的代码所迷惑的评分器。
模型是变量。护栏是倍数。
护栏如何改变一切。
上面的所有实验都改变了模型,保持护栏不变,那个实验的真实总结要小于前沿版本的营销宣传所暗示的:选择最佳模型而不是最差的价值是 0.162 个加权点,从 0.727 到 0.889。我们进行的配套研究则做了反向实验 —— 模型固定,护栏变化 —— 将相同的前沿模型发送到相同的密封问题中,分别通过 Dyad AI 护栏和一个标准的通用编码智能体运行:Claude Code,两者配备相同的定制文档和 Dyad 编译工具。
反向实验对得分的影响更大。相同的模型,相同的问题,几乎相同的成本:标准智能体中的 0.533,Dyad 护栏内的 0.899 —— 一个 0.366 点的差距,超过最佳和最差前沿模型之间 0.162 的两倍。标准智能体并没有在风格分上失分:在相对论动力学问题上,它在运行的每个试验中都得了零分。简单地说:更换模型改变的是谁赢了;更换护栏改变的是物理学是否正确。
两个智能体的评分方式相同 —— 每个智能体所使用的物理模型都被模拟并与两者都看不到的密封参考轨迹进行比较。不同的是每个护栏在评分前强制执行的内容。通用编码智能体也可以推导方程和行为,甚至可以进行验证 —— 没有什么能阻止它,但也没有什么强制它这样做。
Dyad 护栏的目的是特别指导它所包装的 LLM 走物理建模的理想路径。验证是通过构造自然发生的事情。这就是"我的代码编译通过"和"我的物理学通过了求解器的验证"之间的区别,没有任何数量的模型质量可以替代这一点。
所以上面前沿模型的排名是真实的 —— 在单个护栏内部。但它是二阶项。如果你关心的是已证实的能力 —— 智能体能解决的问题集的比例 —— 那么第一个决定是工具 —— Dyad —— 第二个是你能在其中承受的最佳前沿模型。护栏对护栏的研究是独立的报告,即将推出:敬请期待。
这项研究背后的智能体堆栈是 Dyad 3.0 附带的那个,它增加了一个模块化技能系统,使工程师可以用自己的自定义工作流来扩展智能体。文档涵盖了语言、组件库和智能体;Dyad 3.0 发布会是详细介绍。
Dyad 3.0 发布说明
Dyad 3.0 发布说明
视频 · PDF 转仿真与 Dyad 智能体
视频 · PDF 转仿真与 Dyad 智能体
视频 · Dyad 3.0 发布会
视频 · Dyad 3.0 发布会
Fable 展现了最广泛的能力。研究中最高的加权难度得分(0.889),唯一在四个核心问题上全部通过的模型,以及在未解决 HL-20 上的最佳结果 —— 在所有有外部参考值的评分测试中领先。如果所选择的模型在物理上正确是必要条件,Fable 就是应该购买的模型。
GPT 5.6 Sol 在性价比上获胜。在性能上排名第二,每次试验 0.814 分用时 $1.74,大约是 Fable 价格的五分之一,具有一些研究中最佳的独立验证习惯。对于大部分日常建模工作,Sol 是理性的默认选择。
护栏提供了很大的杠杆作用。这里最佳和最差前沿模型之间的差距是 0.162 个加权点;护栏之间的差距超过了这个的两倍。最鲜明的表述:同一个前沿模型在 Dyad 护栏内得分 0.899,在标准编码智能体中得分 0.533。更换前沿模型改变的是排名的十分位数;更换工具改变的是物理学是否正确。先选择护栏,然后选择你能在其中承受的最佳模型。
VP of Modeling & Simulation - JuliaHub
Chris Rackauckas 是 JuliaHub 的建模与仿真副总裁,Pumas-AI 的科学研究总监,MIT Julia Lab 的联合 PI,以及 SciML 开源软件组织的主要开发者。他是 Pumas 项目的首席开发者,在过去三年的每次 ACoP 大会上都因在不确定性量化方法、非线性混合效应建模(NLME)的自动化 GPU 加速以及机器学习辅助 NLME 模型构建(DeepNLME)方面的改进而获得最佳演讲奖。因这些成就,Chris 获得了 ISoP 的新兴科学家奖。
Anas Abdelrehim 是 Dyad 的 AI 团队负责人 —— 他为工程师和科学家构建下一代工具,使未来的技术成为可能。他的工作包括为工程师和行业专家构建和扩展代理模型生成平台,以及使用 SciML 机器学习和 AI 智能体系统增强物理建模、发现和仿真的工作流。
Software Engineer - JuliaHub
Anshul Singhvi 是 Julia 绘图库(Makie.jl)、地理空间(JuliaGeo)和文档生态系统的贡献者,也是 Dyad 团队的开发者。
VP of Modeling & Simulation - JuliaHub
Chris Rackauckas 是 JuliaHub 的建模与仿真副总裁,Pumas-AI 的科学研究总监,MIT Julia Lab 的联合 PI,以及 SciML 开源软件组织的主要开发者。他是 Pumas 项目的首席开发者,在过去三年的每次 ACoP 大会上都因在不确定性量化方法、非线性混合效应建模(NLME)的自动化 GPU 加速以及机器学习辅助 NLME 模型构建(DeepNLME)方面的改进而获得最佳演讲奖。因这些成就,Chris 获得了 ISoP 的新兴科学家奖。
Anas Abdelrehim 是 Dyad 的 AI 团队负责人 —— 他为工程师和科学家构建下一代工具,使未来的技术成为可能。他的工作包括为工程师和行业专家构建和扩展代理模型生成平台,以及使用 SciML 机器学习和 AI 智能体系统增强物理建模、发现和仿真的工作流。
Software Engineer - JuliaHub
Anshul Singhvi 是 Julia 绘图库(Makie.jl)、地理空间(JuliaGeo)和文档生态系统的贡献者,也是 Dyad 团队的开发者。
VP of Modeling & Simulation - JuliaHub
Chris Rackauckas 是 JuliaHub 的建模与仿真副总裁,Pumas-AI 的科学研究总监,MIT Julia Lab 的联合 PI,以及 SciML 开源软件组织的主要开发者。他是 Pumas 项目的首席开发者,在过去三年的每次 ACoP 大会上都因在不确定性量化方法、非线性混合效应建模(NLME)的自动化 GPU 加速以及机器学习辅助 NLME 模型构建(DeepNLME)方面的改进而获得最佳演讲奖。因这些成就,Chris 获得了 ISoP 的新兴科学家奖。
Anas Abdelrehim 是 Dyad 的 AI 团队负责人 —— 他为工程师和科学家构建下一代工具,使未来的技术成为可能。他的工作包括为工程师和行业专家构建和扩展代理模型生成平台,以及使用 SciML 机器学习和 AI 智能体系统增强物理建模、发现和仿真的工作流。
Software Engineer - JuliaHub
Anshul Singhvi 是 Julia 绘图库(Makie.jl)、地理空间(JuliaGeo)和文档生态系统的贡献者,也是 Dyad 团队的开发者。
Anas Abdelrehim 是 Dyad 公司 AI 部门的团队负责人 - 他为工程师和科学家构建下一代工具,使明天的技术成为可能。他的工作包括为工程师和行业专家构建和扩展代理模型生成平台,以及使用 SciML 机器学习和 Agentic 系统增强物理建模、发现和仿真的工作流程
软件工程师 - JuliaHub
Anshul Singhvi 是 Julia 绘图库(Makie.jl)、地理空间(JuliaGeo)和文档生态的贡献者,也是 Dyad 团队的开发人员。
‹ JuliaCon Global 2026 上的 JuliaHub
使用 Dyad Agent 进行交易空间探索 ›
获取 Dyad Studio – 下载并安装 IDE,开始像构建软件一样构建硬件。
阅读 Dyad 文档 – 深入了解语言、工具和工作流。
加入 Dyad 社区 – 与其他工程师交流,提出问题,分享想法。
想获得企业支持、安排演示,或了解我们如何帮助构建定制解决方案?我们随时准备帮助。
JuliaCon Global 2026 上的 JuliaHub
使用 Dyad Agent 进行交易空间探索
《Dyad 快讯》- 7 月版
JuliaCon Global 2026 上的 JuliaHub
使用 Dyad Agent 进行交易空间探索
《Dyad 快讯》- 7 月版