分层采样100题时付费前沿模型领先,但全量5519题时本地70B开源模型反超,说明小样本评测选模型存在严重偏差风险。
我在一组多视角驾驶场景上对视觉语言模型做了一次独立的基准测试:涉及模型对行为后果进行推理的安全关键型多选题。整个测试周期内,我评估了 12+ 个模型——付费的前沿 API 和在消费级 GPU 上本地服务的开源权重模型——在分层采样的 100 道题上进行了头对头比较,对于关键决策进行了完整的 5,519 道题全量测试。所有数据都记录在自托管的实验平台上,所以这里的每一个数字背后都有一次完整的运行记录。
有三个发现出乎我的意料。其中一个改变了我选择模型的方式。
在分层采样上,前沿 API 领先:付费模型中排名前两位的得分是 79 和 77,中间梯队约在 72 附近。
但最佳的开源权重模型——本地服务、零边际 token 成本——在完整测试上达到了约 78%,击败了本次测试中所有的付费前沿 API,并且在没有做任何微调的情况下超越了一个已发布的微调基线 72.9%。
仔细看这个顺序,因为两部分都很重要。在小样本上,前沿模型领先。在完整运行上,本地模型守住了优势,差距发生了反转。如果我在采样阶段就停下来——大多数模型选择流程都是这样做的——我会选一个 API 并为此付费。
成本不对称进一步放大了这个问题。针对前沿 API 进行完整的 5,519 道题测试是一笔真金白银的开销;针对本地模型只是一点电费。这意味着你恰好能在成本最低的地方做完整测试,而在成本最高的地方被迫采样——这对决策质量来说恰恰是本末倒置。
我精心构建了 100 道题的采样——类别比例与完整测试的差异在 0.5 个百分点以内。这已经是一个采样能代表完整分布的极限了。
但它还是在最糟糕的时刻对我撒了谎:选择微调基座模型时。两个候选模型在采样上得分相同。在完整测试上,它们是 66.7 对 61.3——差了五分,而采样把差距压缩成了零。我根据完整测试的证据做出了判断,并记录了原因。
这个教训不是说"采样没有用"。而是采样误差棒恰好在你需要分辨率的地方最大:两个相近的模型之间。用采样来筛选候选,不要用它来在相近的候选之间做决定——当完整运行可行的时候,而本地服务通常使完整运行变得可行。
本次测试中最有趣的单模型是一个 35B 推理("思考")模型,总体得分 73——初看属于中游。但分解后讲述了一个不同的故事:在不确定性判断和安全关键预测上拿到了本轮最佳分数,却被交通信号题目的弱表现拖了后腿。
这不是一个弱模型。这是一个有能力的模型,只是还没有学会基准测试的惯例——它在困难、模糊的情境上推理得很好,却在一个主要考察是否了解预期输出风格的类别上翻了车。两种失败模式在总分上看起来一模一样,但含义完全相反:惯例差距通过轻量微调很容易修复;能力差距则不然。
这让我把建议从"使用更大的模型"改成了"对有能力的模型做轻量微调"——一条更便宜的路,达到更好的结果,这是从分类分解而非总分数字得出的结论。
在假设需要 API 之前,先试试本地服务开源权重。对于结构化的评估工作负载,一个选对了的开源模型在消费级硬件上就能与前沿 API 竞争,而且零边际成本改变了你能承受什么样的评估 rigor。
聚合分数掩盖了决策相关的结构。在得出任何结论之前,先按类别分解结果。能力强-惯例弱和惯例强-能力弱得分相同,但需要的干预措施截然相反。
把评估预算花在决策接近的地方。大差距在采样中就能看出来;接近的决断则不能。完整运行是为了那些难分伯仲的时刻。
记录一切。以上每一条结论之所以站得住脚,是因为运行数据都在实验追踪器里,配置已固定。另一种选择是一个月后你都想不起来源的数字表格——没有溯源的基准测试数字就是营销材料。
需要说明的几点:这是一个基准测试,在一个领域(驾驶场景),一种题型(多选题,有可验证答案)。前沿 API 在其他地方很可能占优——长文本生成、工具使用、冷门知识。我的主张更窄,但我觉得也更有用:对于结构化的视觉推理评估,"默认用前沿 API"的本能花的是真钱,而且在本次测试中没有胜出。
我写关于机器学习评估、世界模型以及测量如何悄然失效的话题。更多内容见 dev.to/rickeshtn。