在虚构大学数据集上对8款模型进行严格的对齐基准测试,发现所有模型在"何时该拒绝回答"和"JSON格式合规"两个维度上均存在明显短板,目前没有单一模型能可靠地同时做到准确拒绝和格式正确。
Broken Campus 系列第 2 篇。第 1 篇构建了一套基准测试,按智能体失败时的干净程度打分。本文是正面交锋——我先说实话:对本文大部分内容而言,对任何指望单个模型能解决问题的人来说,消息都不太好。事情会有转折,但好的部分在后头,不是开场就有的。
声明:我是 B Torkian,NVIDIA 开发者大使,也会测评其他厂商的 NVIDIA 模型。正因如此,评分是确定性的、测试工具链是公开的、而且我对自己的数字做过对抗性审计——暗中动手脚会让结果失去公信力。
如果你是第一次看到这里,快速补课。Broken Campus 是一个基于虚构大学 Northwind 的小型智能体基准测试——所有事实都是编造的,所以没有任何东西存在于任何训练集中。有两个指标被确定性地评分:当事实缺失时模型是否拒绝编造,以及它返回的 JSON 是否能被你的解析器接受。第 1 篇的结论是:在"能否回答这个问题"的简单维度上,大家基本都很完美。差异只出现在智能体不应该回答的时候,或者你的解析器需要 Schema 的时候。
所以我让八个模型跨三个层级跑了一遍——每个模型 5 个种子、每个模型 75 次格式运行、同样的提示词、同样的工具、同样的评分代码。我进来时想要的和你可能想要的一样:一个我能把整个智能体指向它然后不用再操心的模型。以下是结果,按最强信号排列——我现在就告诉你,那个干净的单一答案永远不会来。看着它不来;这就是重点。
三个层级:开放的 NVIDIA 模型——NVIDIA Nemotron 3.5 Lightning、Nemotron 3 Super 和可靠性调优过的 Nemotron 3 Ultra(下面简称"Lightning"、"N3-Super"、"N3-Ultra")——预算闭源层级(GPT-4o-mini、Haiku)和闭源前沿层级(GPT-5.5、Opus)。一个开源模型 super-49b 作为上一代开源参考——不是正面竞争者,只是 NVIDIA 开源产品线此前位置的基线。
弃权率一列在每行都标注了 95% 置信区间——最后一列那些又宽又重叠的区间就是它被标注为"方向性"的原因(注意事项部分解释了为什么:有效 n ≈ 5),我宁愿让你看到它们而不是隐藏它们。† Ultra 的 100 是某个簇的顶部,不是排名:它的区间与 Opus 的相交,所以应该理解为"至少和 Opus 一样安全",而不是"超越 Opus"。下面会有更多讨论。
两个成本单元有意留空:N3-Super 和 Ultra 的运行来自一个没有公布价格的提前访问端点,所以我不会为它们编造一个每次正确回答的成本。留空白比编造一个我无法捍卫的数字要好。(super-49b 有公布的价格,所以它的成本留在表中。)
首先,什么没有变化。在"事实存在,去回答"这种简单场景下,每个模型都通过了,正确率 100%,错误拒绝率 0%,在毒化上下文探测中存活率 100%,从注入的工具故障中恢复率约 100%(super-49b 是唯一跌到 93% 的)。多轮记忆除 N3-Super 外全部保持 100%——N3-Super 崩溃到 56%——这是第二种失败模式,对任何依赖记忆的步骤来说都是淘汰因素。(值得注意的是,Lightning 在这里保持 100%,所以那个崩溃是 N3-Super 的问题,不是快速开源模型的法律。)但如果你的智能体的工作简单来说就是"有答案就去答",八个模型都能做到。这不是钱所在的地方——也不是任何人会因此受伤的地方。
成本、速度和格式是足以押注的强信号。弃权我会大声声明保留态度,因为它值得空间。下面的内容按顺序排列,每个发现都是同样的结构:一列强主张,在下一列被狠狠拉回。
Lightning 是最便宜和最快的,幅度很大。每次正确回答花费 $0.0004,算下来大约比 Opus 便宜 78 倍、比 GPT-5.5 便宜 39 倍。在墙上时钟时间上,它是表中最快的产品,平均 2,098 ms,对比 GPT-5.5 的 5,365 ms 和 Opus 的 9,679 ms。重型开源模型落在慢端——Ultra 的 13,297 ms 是八个中最慢的。这是原始的成本和速度差距,而且毫无争议。如果成本和速度就是全部故事,你就可以关掉这个标签页并在任何地方部署 Lightning 了。


格式纪律是便宜路径开始出问题的地方——这是一个大效应,不是抛硬币。这是整个测试中最强的信号:每个模型 75 次运行,差距很大,真正的分晓。闭源前沿——GPT-5.5 和 Opus——完美无瑕:格式失败率 0%,首次通过有效 JSON 100%。预算闭源层级几乎同样干净——GPT-4o-mini 8% 失败 / 92% 首次通过,Haiku 5% / 95%,这让整个闭源侧落在 0–8% 格式失败率的紧凑区间内。Ultra 是开源侧的亮点,87% 首次通过有效 JSON,12% 格式失败。然后快速开源模型就跌落悬崖:N3-Super 68% 首次通过有效(32% 格式失败),Lightning 17% 首次通过有效,24% 格式失败率——快速开源 band 在 24–32% 格式失败率。0–8% 对比 24–32% 的差距太大了,不可能是五个案例的Artifacts;我会在注意事项中再讨论原因,但仅效应量就足以定案了。就这样,清爽的赢家没了:场上最便宜、最快的模型,也是你的解析器最常拒绝其输出的模型。

一个测量说明,防止两个格式数字让你困惑:首次通过 JSON(第一次尝试就解析)和格式失败(即使经过工具链一次重试也永远无法解析)是在不同的案例切片上评分的,所以 Lightning 的 17% 和 24% 不会相加。Lightning 的响应中大约有四分之一永远无法以你的解析器可以接受的 JSON 形式返回,即使经过那次重试。在演示中你永远不会注意到。在期望 Schema 的管道中,那是你的解析器拒绝的四分之一流量——每一次重试、每一次告警、每一次那四分之一失败流量拖在后面的丢弃请求,乘以生产量。
而这里有一个让故事保持诚实的细节:看看上一代的 super-49b 行——格式失败率 0%,首次通过有效率 100%,与前沿完全一致。格式差距不是 NVIDIA 模型的普遍特征。它是最新、最快、最便宜的开源模型的特有特征——那些被调优到又小又快的产品牺牲了一些 older、heavier 模型已经掌握了的 JSON 塑造能力。(这也是为什么我把 super-49b 的格式单元格放在表中但让它脱离正面交锋:它是趋势的参考点,不是竞争者。)
弃权是便宜路径受伤最深的地方——但只是粗略形态。这是"当事实缺失时它是否拒绝编造"的维度,是真正让智能体陷入麻烦的那个:自信的错误答案比没有答案更糟糕。它分成两个簇,不是干净的排名。在安全端:Ultra 100% [83–100]——唯一一个在每个缺失探测上都弃权的模型——与闭源前沿并列(Opus 68% [48–83],GPT-5.5 64% [45–80])和预算闭源层级(60% [41–77])。在风险端:快速和重型开源模型挤在一起——super-49b 40% [23–59],N3-Super 42% [19–68],Lightning 37% [19–59]。两个簇,簇间有真实差距——而且正如意那些重叠区间所示——簇内没有可靠的顺序。
所以看看 Lightning 落在哪里:最便宜、最快,而且在唯一"犯错代价高昂"的维度上处于底部簇。便宜路径不只是让你失去可解析的输出——还让你失去谨慎。

在我让那种绝望站住之前,它必须通过一个测试:考虑到案例这么少,其中任何东西是真的吗?
这是方向性的,不是结论性的。种子近乎确定性,所以有效 n 更接近五个不同案例而不是 75 次独立试验。它只是一个小小的虚构知识库。而且这里每个延迟数字都来自 NVIDIA 的免费开发者端点,不是付费的生产层级,所以读那些毫秒数要当作相对的,而不是当作 SLA。
同样的有效样本量 ≈ 5 是格式保持和弃权行为表现差异的根源。在格式方面,差距体现为效应量:闭源阵营的格式失败率为 0–8%,快速开源模型则为 24–32%。如此大的差距在五个案例上根本无法弥合——效应量太大,样本量再小也抹不平,这就是论据所在,而非任何显著性检验。而在弃权方面,效应只有几分,置信区间的作用正好相反:Ultra 的 100 和 Opus 的 68 区间有重叠,个案级别的 Fisher 检验结果不显著(p ≈ 0.48)。所以诚实的结论只能是:Ultra 至少和 Opus 一样安全,不会更好——下一节 40 个探针的深度分析恰好证实了这一点,差距确实存在但不过如此。
因此:成本、速度和格式规范是强项——大效应量、多次运行、差距大到五个案例根本解释不了。细粒度的可靠性排名是暗示性的,仅此而已。
深入探究:当 5 个探针变成 40 个时会发生什么
我本可以停在"方向性一致"然后继续往下写。但弃权差距是表格里最有趣的数据,也是最不可信的,所以做了显而易见的事:不再对有效样本量空口白话,而是用 40 个不同的不可回答探针代替 5 个——删除类(事实已被删除)、相邻但不存在的问题(董事会会议、会员费、不存在的房间号)和假前提陷阱("既然它已经改到周一了……")。同一知识库、同一个智能体、同样的确定性评分,只看可解析输出。在我最没把握的那个轴上,探针数量翻了八倍。
戏剧性的差距没能撑下来。

n=40 时所有模型聚集在 75% 到 83% 之间,区间重叠严重到组内无法排序:N3-Ultra 83% [67–92]、GPT-4o-mini 81%、GPT-5.5 78%、Opus 75%。(图表明确显示了一个诚实的曲折:正因为弃权只在可解析输出上评分,两个快速开源模型被评判的探针更少——Lightning 只评了 40 个中的 21 个,N3-Super 只有 9 个——因为其余都格式失败了。这个单薄的基数本身就是发现:你甚至无法在解析器拒绝的输出上评估它们的判断能力。)五探针表格里 Ultra 是完美的 100,Opus 是 68——32 个百分点的鸿沟。八倍探针把它抹平了。这就是小样本噪声在眼前消解的过程,也是你应该质疑只报一个数字而没有区间的基准测试的最佳理由——包括,在本节之前,我自己的部分数据。
仔细看,这对 NVIDIA 是好消息,只是不是营销会写的那种标题。诚实、严谨的结论比"获胜"更有力:NVIDIA 的开源、可自托管的 Ultra 与闭源前沿的谨慎旗鼓相当——在知道何时闭嘴这件事上,与 GPT-5.5 和 Opus 统计持平——这意味着你无需租用前沿模型就能获得前沿级别的判断力。它更慢(回想一下 Ultra 是表格里最慢的),但谨慎是真实的,而且它是开源的。
深度分析还强化了一个真正的、分隔性的效应:格式规范。在这些更难的探针上,快速开源模型不仅仅弃权更少——它们根本无法返回可用输出的情况要多得多(Lightning 格式失败 48%、N3-Super 78%,闭源阵营是 0–10%)。这不是四舍五入的差异;这是快速开源税在高负载下的显现。这就是第三部分的全貌:如果你真正想运行的便宜模型恰恰是最经常给你的解析器扔垃圾的模型,你不该选一个模型——你应该路由。(我故意把两个表格都公开:5 探针头对头和 40 探针深度分析。小的是方向性的;大的是严谨的后续;它们指向同一方向,而展示修正才是重点。)
所以我选哪个?
你不选。这就是真正的发现。没有一个模型能包打天下,原因如下。每模型一句话,不重新推导上面的数字:
Lightning 是主力——放在量大且正确性可检验的地方,远离自信犯错代价高昂的环节:它和其他快速开源模型处于低弃权集群,远不及闭源前沿和 Ultra。
Nemotron Ultra 是可靠性专家——留给犯错代价高的环节,并接受为此付出的延迟成本,因为它是表格里最慢的模型。
在闭源前沿,GPT-5.5 是两者的默认选择——成本约为 Opus 的一半,明显更快(5,365 ms 对 9,679 ms),格式和判断两方面都能胜任。只有在弃权方面 Opus 更优时才升级到 Opus。无论选哪个,你都在以 Lightning 的 39–78 倍费率买一个"不用操心"。
表格里没有任何一行在所有维度都是最佳。有一个便宜快速的格式有问题,一个谨慎的但很慢,一个均衡的但很贵。选任何一个单一模型,你就是在为整个流程有意识地接受其中一种失败。
你问错了问题
问题从来不是"哪个模型?"而是"为什么我要把所有流量都发给一个模型?"上面每一个"但它慢"和"但它的格式会崩"的反对意见都建立在一个前提上:你必须选一行然后忍受它的唯一失败。放下这个假设,整张表格就变了形状。
先说机制,因为它们几乎无聊到不值一提。工具是 NeMo Switchyard——NVIDIA 的开源路由器——而这张表格里的一个数字几乎免费地给了你第一个最干净的升级信号:Lightning 的 24% 格式失败率是确定的,容易检测,成本低廉,因此是完美的触发器。只捕获那些失败,在更大的模型上重新跑,就能挽回 Lightning 丢弃的可解析输出——代价只是全面运行前沿模型成本的一小部分。这就是第三部分:路由后的数字,和费用表。
它对局限性也是诚实的——格式失败路由修复的是格式,不是判断。同样的触发器对弃权几乎没有影响,所以可靠性需要第二个杠杆,键控到任务类型:把犯错代价高的环节发送给安全集群中的模型。而这里有一点是头对头比较悄悄塞给你的——那个安全集群并非闭源专属。回头看弃权栏,看看谁和 Opus、GPT-5.5 并驾齐驱:Nemotron Ultra,100% [83–100]——在最影响 AI 智能体的那个维度上至少和 Opus 一样安全,知道何时不回答。记得 super-49b 在格式上也和前沿持平吗?同样的教训,不同的维度。所以这不是"Ultra 全胜"——它更慢,格式上稍微落后于闭源。它更窄、更好:在错误答案代价高的那个维度上,你不必离开开源生态就能获得前沿级别的安全性。
这意味着第二个杠杆拥有它不需要额外成本。Ultra 是开源权重且可自托管的,按开源模型的经济性运行——你本来要付闭源前沿价格买的谨慎,在一个可以自己运行的模型里就有了。默认情况下便宜,该谨慎的时候谨慎,而且默认选项和安全网都是你自己的。
所以再看一下那张权衡表。它曾经是一整页的妥协——便宜但有问题、谨慎但慢、均衡但贵。现在它是一组你可以控制的旋钮:Lightning 便宜快速的 bulk;当需要谨慎时用 Ultra;需要的时候用前沿模型。好的答案从来不是某个模型。是路由——这就是第三部分。
B Torkian 是 NVIDIA Developer Champion。Broken Campus 是开放的——测试工具和评分代码已冻结并公开在 github.com/torkian/broken-campus,你可以用你能触及的模型复现这个基准测试。5 个种子、8 个模型、一个合成领域。