前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9013
  • 决策模型:只返回概率、拒绝生成文本的新范式
  • AI购物Agent遭评测攻击:恶意评论注入钓鱼
  • GPT-6 Astra百万token成本拆解:何时值得用
  • MCP 服务器悄然变更工具描述 = 你的 Agent 在执行未知指令
  • GitHub Copilot 已上线 Claude Sonnet 5.5
  • Claude Sonnet 5.5 编程 benchmark 暴涨 6 倍,成本降三成
  • Anthropic发布Sonnet 5.5:半价达到 Opus 水平
  • Claude Sonnet 5.5 发布:性价比翻倍
  • VoiceStudio: 开源全本地语音克隆,支持646语言和MCP
  • 企业级AI代理界面设计:让记忆成为第一公民
  • OpenAI代理绕过限制:通过DNS隧道实现隐蔽通信
  • IDE 不够用:构建 Agentic 开发环境 ADE
  • Agent 记住了修复方案却错了:AfterTrace 事件恢复工具
  • 代理工具调用经济学:告别靠猜
  • OpenAI代理利用Google安全游戏漏洞抓取UN数据
  • 小米 MiMo-V2.6 开源登顶 AA 指数,超越 Kimi K3
  • 代码生成自动化了,代码审查却没有:AI辅助PR的真相
  • Cloudflare推出cf CLI:Agent化的全API命令行工具
  • Nvidia在芯片层引入AI Agent看门狗:毫秒级隔离
  • pgEdge:AI 编程助手造的数据库分支无法合并,这才是设计原意
  • 月之暗面 Kimi K3.1 曝光:100 万 Token 上下文
  • Cloudflare 开源 Forge:自动生成 API SDK 和文档
  • 英伟达推 AI Agent 安全平台:毫秒级隔离失控 Agent
  • EmDash 1.0:面向Astro的安全开源CMS
  • Cloudflare Kitesurf浏览器升级:730K平台测试通过,支持WebMCP
  • Cloudflare 收购 VoidZero 后:JS 工具链提速 10 倍
  • RAG原理解析:从第一性原理出发
  • 16 岁少年用 AI 机器人 Antares 发现微软内部 API 漏洞:涉 17 万亿行数据
  • Nvidia推出Open Agent安全平台,管控越狱AI智能体
  • Holo4:通用计算机操作智能体的底层支撑
  • 英伟达发布 AI 智能体安全平台:毫秒级异常隔离
  • 已加载 31 / 9013
8.0
热点
AI SCORE
编程提效2026-09-29 02:29

决策模型:只返回概率、拒绝生成文本的新范式

dev.to · AI#决策模型#分类#成本优化
Editor brief · 编辑速览

Jev、Laya等决策模型专为分类设计,输出结构化概率而非文本,避免了幻觉和解析问题,$104即可训练144M参数版本。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

你的 pipeline 里,有多少「LLM 调用」其实根本不需要模型写任何东西?

老实说。大量调用本质上是披着对话外衣的分类:

"这张工单是关于账单、Bug 还是功能需求?"

"这个操作应该被允许还是上报?"

"这条评论是不是水军?"

"这 4 条路由哪个匹配?"

你花大价钱调用生成模型吐 token,然后再把 token 解析回一个决策——还得祈祷它别突然话多,别在 JSON 外面套个道歉,别凭空编出第五个分类。

有一类新模型正在悄悄戳穿这一点。决策模型——Jev(TypeSafe)、它的开源复刻版 Laya,以及据传以 144M 参数、花了 104 美元训练的某一个——做的是聊天机器人的反面:它们拒绝生成文本。它们接收一个结构化问题,输出一个校准后的概率。就这么多。

为什么「不写文字」是特性,不是局限

当一个模型的唯一输出是固定选项集合上的一个数字时,三个问题直接……消失了:

无需解析。 不存在「有时返回 markdown,有时返回代码块,有时返回纯文本」的情况。输出永远是一个分布,形状始终如一。

无法幻觉。 它不会凭空发明一个新分类或给出一个错误理由,因为它根本不生成自由文本。

置信度已校准。 一个好的决策模型会告诉你它有多确定——0.51 还是 0.99——这恰恰是把不确定的 case 转给人工判断时需要的。LLM 的「我很 confident!」只是感觉;校准后的概率是一个你可以设阈值的数字。

而且经济账完全倒向你这边。一个 144M 参数的模型在普通硬件上只需几十毫秒就能跑完,成本几乎可以忽略不计。当报道的训练费用只有两位数时,推理成本几乎归零。对比一下:一个前沿 LLM 做同样的是非判断,每百万 token 收费 10–50 美元,还要加上延迟。

它们的适用场景(和不适用场景)

当任务本质上是决策时,用决策模型:

  • 分类与路由
  • 过滤 / 审核门禁
  • 工具调用前的「agent 是否应该执行这个动作?」检查
  • 排序与相关性打分
  • 任何你目前正在用正则从 LLM 答案里解析回枚举值的场景

当你真正需要语言时,保留 LLM:

  • 生成回复、摘要、代码
  • 输出空间不固定的开放式推理
  • 任何「写一段话」本身就是本职工作的地方

在严肃 pipeline 中正在形成的模式是:前面用一个便宜的决策模型做路由、过滤、把关;只在真正需要文字的调用时才动用贵的生成模型。你不再为是非判断支付前沿模型的价格,也不再把 prose 解析成布尔值。

结构化输入是有真实成本的。这些模型需要一个定义好的问题 schema,而不是自由格式的 prompt。把一个围绕「直接 prompt 就完事」构建的 pipeline 改造成这样需要不少工作。

开源 vs 闭源很重要。Jev 是闭源的;Laya 是开源替代品;生态还年轻,工具链比你习惯的 LLM 世界要粗糙。

它们不会显式推理。如果你能读到的理由是刚需,那沉默的概率值满足不了——不过「返回数字,只在人类需要时让 LLM 补解释」是个不错的混合方案。

真正的收获是思维转换:不是你的系统做的每个决策都需要一段话加一个解析器。有些只需要一个校准良好的数字——现在终于有一个便宜、不幻觉的工具专门为你打造了这个。

你现在的 LLM 调用里,有多少其实只是从 prose 里解析回来的分类?老实数一数——我赌比你以为的多。👋

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
下一篇
AI购物Agent遭评测攻击:恶意评论注入钓鱼