Jev、Laya等决策模型专为分类设计,输出结构化概率而非文本,避免了幻觉和解析问题,$104即可训练144M参数版本。
你的 pipeline 里,有多少「LLM 调用」其实根本不需要模型写任何东西?
老实说。大量调用本质上是披着对话外衣的分类:
"这张工单是关于账单、Bug 还是功能需求?"
"这个操作应该被允许还是上报?"
"这条评论是不是水军?"
"这 4 条路由哪个匹配?"
你花大价钱调用生成模型吐 token,然后再把 token 解析回一个决策——还得祈祷它别突然话多,别在 JSON 外面套个道歉,别凭空编出第五个分类。
有一类新模型正在悄悄戳穿这一点。决策模型——Jev(TypeSafe)、它的开源复刻版 Laya,以及据传以 144M 参数、花了 104 美元训练的某一个——做的是聊天机器人的反面:它们拒绝生成文本。它们接收一个结构化问题,输出一个校准后的概率。就这么多。
为什么「不写文字」是特性,不是局限
当一个模型的唯一输出是固定选项集合上的一个数字时,三个问题直接……消失了:
无需解析。 不存在「有时返回 markdown,有时返回代码块,有时返回纯文本」的情况。输出永远是一个分布,形状始终如一。
无法幻觉。 它不会凭空发明一个新分类或给出一个错误理由,因为它根本不生成自由文本。
置信度已校准。 一个好的决策模型会告诉你它有多确定——0.51 还是 0.99——这恰恰是把不确定的 case 转给人工判断时需要的。LLM 的「我很 confident!」只是感觉;校准后的概率是一个你可以设阈值的数字。
而且经济账完全倒向你这边。一个 144M 参数的模型在普通硬件上只需几十毫秒就能跑完,成本几乎可以忽略不计。当报道的训练费用只有两位数时,推理成本几乎归零。对比一下:一个前沿 LLM 做同样的是非判断,每百万 token 收费 10–50 美元,还要加上延迟。
它们的适用场景(和不适用场景)
当任务本质上是决策时,用决策模型:
当你真正需要语言时,保留 LLM:
在严肃 pipeline 中正在形成的模式是:前面用一个便宜的决策模型做路由、过滤、把关;只在真正需要文字的调用时才动用贵的生成模型。你不再为是非判断支付前沿模型的价格,也不再把 prose 解析成布尔值。
结构化输入是有真实成本的。这些模型需要一个定义好的问题 schema,而不是自由格式的 prompt。把一个围绕「直接 prompt 就完事」构建的 pipeline 改造成这样需要不少工作。
开源 vs 闭源很重要。Jev 是闭源的;Laya 是开源替代品;生态还年轻,工具链比你习惯的 LLM 世界要粗糙。
它们不会显式推理。如果你能读到的理由是刚需,那沉默的概率值满足不了——不过「返回数字,只在人类需要时让 LLM 补解释」是个不错的混合方案。
真正的收获是思维转换:不是你的系统做的每个决策都需要一段话加一个解析器。有些只需要一个校准良好的数字——现在终于有一个便宜、不幻觉的工具专门为你打造了这个。
你现在的 LLM 调用里,有多少其实只是从 prose 里解析回来的分类?老实数一数——我赌比你以为的多。👋