详细对比决策AI模型(返回校准概率而非生成文本),TypeSafe Jev每百万输入token约$0.042、响应70-500ms,对比GLiDE、GLiNER2.5-Decide等开源方案。
Decision AI 模型是一类新型模型,它返回的是决策而非段落。你发送带有类型化问题的文本,模型返回你的代码可以直接分支判断的选项、评分或 yes/no 概率。
这个类别在 TypeSafe AI 秘密研发两年后推出 Jev 时进入主流视野。TypeSafe 称之为"System One 模型",取自 Daniel Kahneman 的快速直觉式 System 1 思维。
在短短 3 周内,Fastino Labs 推出了两款竞争模型,开源开发者也发布了几个 Jev 风格的复现项目。本文涵盖这类模型的工作原理、适用场景以及各选项的对比。
Jev 接受一个"状态"(字符串、数组或键值对集合)和一个或多个问题。根据 TypeSafe 文档,它支持 3 种原语:
Choice:从列表中选择一个选项,带概率和置信度。TypeSafe 称 Jev 支持最多 255 个选项。
Score:按有序等级 rubric 对状态评分,带概率和置信度。
Noul:某个陈述为真的 0 到 1 概率。名称取自伯努利分布。
每个问题都针对同一状态并行且隔离地评估。添加问题几乎不会改变响应时间。因为 Jev 永远不会生成字符串,TypeSafe 称它不会返回类型错误。
在底层,TypeSafe 描述了一种新架构、一种并行采样器,以及一种名为 Reinforcement Learning for Calibrated Decisions(RLCD)的训练方法。RLHF 优化人类偏好。RLCD 优化校准概率,即更高的置信度应该意味着更高的准确率。
定价是需要关注的关键。Jev 每百万输入 token 收费 $0.042,输出免费。OpenRouter 列出 32K 上下文窗口。TypeSafe 报告端到端响应时间为 70 到 500 毫秒。
TypeSafe 在 4 个任务上构建了工作流评估:安全事件、Agent 链路可观测性、发票处理和客户服务。参考标签来自 GPT-6 Astra 和 Claude Fable 5.1 高思考模式下的平均结果。
Jev:67.8% 平均准确率,每个案例 $0.0004,0.4 秒。
Claude Sonnet 5(相同工作流):67.8%,每个案例 $0.1174,78.1 秒。
最佳对比模型(OpenAI "sol"):74.1%,每个案例 $0.0836,23.3 秒。
Jev 在准确率上与 Sonnet 5 持平,成本和延迟却只是零头。但仍比顶级前沿配置低 6.3 分。按任务来看,Jev 在客户服务上得分 76.0%,但在发票处理上仅得 61.8%。
经验法则很简单。如果你的代码需要一个有界的、它将分支判断的答案,Decision 模型就是一个候选。如果输出需要人类阅读,就用 LLM。
选择下一个工具或子 agent:Vercel 将此列为主要用途。
Continue、retry、询问用户或停止:单个 Choice 问题即可替代脆弱的 JSON 解析步骤。
模型路由:将简单请求发往廉价模型,复杂请求发往前沿模型。Fastino 列出了按目标、复杂度或升级级别进行路由。
分类与分诊
支持工单路由、邮件分类和意图检测:这些构成了 Fastino 17 数据集基准的大部分。
垃圾检测、标签建议和优先级排序:Simon Willison 称这些是天然的分类适用场景。
安全告警分诊:TypeSafe 发布的简化工作流判断是关闭告警、转给分析师还是隔离。
验证与安全
护栏和越狱检测:TypeSafe 推荐用 Jev 对提示词、推理链路和输出进行评分。
联合安全检查:GLiNER2.5-Decide 可以同时解码"safety"和"harm type",使答案永不矛盾。
验证级联:OpenRouter 的 Jev 指南描述了用廉价模型起草、Jev 检查、仅在失败时升级的模式。
评估与可观测性
LLM-as-a-judge 替代:Arize 和 Langfuse 现在在链路上运行 Jev 评估器。
CI/CD 门控:Buddy 让流水线可以用 Jev action 进行评分、分类或门控运行。
搜索与数据处理
重排序:一次并行调用对 100 个 BM25 候选结果进行相关性评分。
大规模数据集上的 Map-reduce:TypeSafe 推荐以低成本将批量数据转化为特征。
上下文剪枝:Fastino 列出了在 LLM 调用前选择保留哪些上下文。
实时应用
游戏与模拟:TypeSafe 演示了 Jev 玩 Doom 和 Wikiracing。
延迟敏感的 UX:亚秒级决策使 AI 可用于交互式流程中。
需要生成的文本、摘要或解释。
任务需要精确的算术、计数或日期计算。TypeSafe 的 Jev 1.13 不规则性指南标记了这 3 类。
决策影响人们生计时,比如招聘。Willison 警告隐藏的偏见很难检查。
1. Vercel AI Gateway 采用
Vercel 报告 Jev 成为 AI Gateway 历史上采用最快的模型。24 小时内,近 13% 的付费团队在使用。这 GPT-5.6 家族占比的 2 倍,是 Fable 5.1 的 6 倍多。
2. BM25 + Jev 重排序
Simon Willison 用 BM25 获取 100 个候选结果,然后让 Jev 对每个进行相关性评分。这个模式用廉价的并行 Score 问题替代了昂贵的 LLM 重排序器。
3. LLM 评估流水线
Arize 和 Langfuse 都推出了 Jev-as-a-judge 评估器。Langfuse 将该功能标记为"decision-model evaluators",以便后续添加其他模型。其 Jev 支持仍标记为实验性。
4. 6G 边缘网络编排
一篇新的 arXiv 论文用 Jev 在网络边缘解释服务合约。在准确率相当的情况下,Jev 将中位决策延迟相比 DeepSeek 降低 22.4%,相比 Gemini 降低 61.9%。
5. 实时游戏 Agent
TypeSafe 的 Doom 演示以每秒 10 次查询的速率运行 Jev。团队估计成本约为每小时 $7。
下表涵盖 Jev、其最接近的商业竞争对手和领先的开源权重模型。所有规格来自各项目的发布页面或模型卡。
| Model | Developer | License / access | Size and architecture | Question types | Reported latency | Runs locally |
|---|---|---|---|---|---|---|
| Jev 1.13 | TypeSafe AI | Closed; hosted API at $0.042/M input, output free | Not disclosed; new architecture, parallel sampler, RLCD | Choice, Score, Noul (up to 255 options) | 70 to 500 ms | No |
| GLiDE | Fastino Labs | Closed; Fastino API, 40K context | Not disclosed; adaptive thinking on uncertain cases | Selected action, confidence and option probabilities | Not disclosed | No |
| GLiNER2.5-Decide | Fastino Labs | Apache 2.0 open weights; also on Fastino API | 340M DeBERTa-v3-large encoder | Typed decisions with joint constraints, plus spans and relations | 38.3 ms p50 (V100), 167.3 ms (48-vCPU CPU) | Yes, CPU or GPU |
| Laya | Convai Innovations | Apache 2.0 open weights | 421M ModernBERT-large (English); 322M mmBERT-base (multilingual) | Choice, Score, Noul; 100+ languages | ~33 ms per question on GPU | Yes |
| JevK5 | Independent developer | Apache 2.0 open weights | 4B, Qwen3.5-4B with merged LoRA | Probability for every option in one pass | Not stated | Yes, GPU |
| OpenJev | Theo Lee | MIT | Frozen Qwen3.5-4B, reads option logits | Typed options in one pass | 5.21x faster than autoregressive JSON | Yes, consumer GPU |
| kev-0.5b | Jared Palmer | Apache 2.0 (base under Qwen license) | LoRA plus readout head on Qwen2.5-0.5B; Jev-compatible API | Noul, Choice (2 to 255), Score | ~160 ms for 6 questions (Apple M5) | Yes, laptop |
| General LLM + structured output | Many | Mostly closed; input plus output tokens | Autoregressive decoder | Anything, as generated text | Typically seconds | Depends |
这些分数来自不同的测试套件。请勿跨行比较数字。
基准测试(报告方)
工作流评估(TypeSafe):Jev 67.8%, Sonnet 5 67.8%, 最佳 LLM 74.1%
Decision Index 0.2.1(Fastino):GLiDE 64.81, Jev 57.91
CLadder 准确率(Fastino):GLiDE 88.7%, Jev 72.6%
CRUXEval 准确率(Fastino):GLiDE 92.6%, Jev 73.0%
Fast Decisions, 17 数据集(Fastino):GLiNER2.5-Decide 60.1%, JevK5 57.5%, SemIf 56.4%, GLiFormer 49.0%, Laya 46.6%
102 行 TypeSafe 评估子集(OpenJev):Jev 0.883, OpenJev 0.845 balanced accuracy
有两个注意事项需要注意。Fastino 为其 GLiDE 和 GLiNER2.5-Decide 的声明同时选择了测试和对手。其 Fast Decisions 比较也使用了 JevK5(开源复现版),而非 TypeSafe 的 Jev。
选 Jev可以获得目前支持最广泛的托管 API 和生态。
选 GLiDE可以测试更难、更推理密集的决策,并在自己的数据上验证 Fastino 的声明。
选 GLiNER2.5-Decide适用于气隙部署、微调,或必须遵守跨问题约束的答案。
选 Laya适用于多语言决策或极低的单问题延迟。
选 kev、OpenJev 或 JevK5可以在本地实验或避免供应商锁定。
这个想法并不新鲜。分类器和重排序器已经做决策多年。Decision Transformer(2021)将强化学习框定为序列建模。DeepMind 的 Gato(2022)展示了一个通才模型跨多任务行动。2023 年的一项调查甚至称"大型决策模型"是下一步。
2026 年改变的是包装方式。4 股力量推动了这一转变:
Agent 需要廉价的判断:路由、工具选择和护栏在每个工作流中发生数千次。为每一次支付前沿模型的价格不可扩展。
校准使自动化成为可能:置信度分数让代码在有把握时独立行动,在没把握时升级。
生态快速跟进:在短短几周内,Jev 登陆了 Vercel、OpenRouter、Arize、Langfuse 和 Buddy。
竞争随即到来:Fastino 于 9 月 24 日发布 GLiNER2.5-Decide,9 月 30 日发布 GLiDE。kev、OpenJev 和 JevK5 等开源复现项目也同期出现。
Decision 模型和 LLM 是一样的吗?
答案是否定的。Decision 模型像 LLM 一样读取文本,但输出的是预定义答案的概率。它不能写作、摘要或解释。
什么时候应该用 Decision 模型而不是 LLM?
将其用于高容量、有界的判断:分类、路由、分诊、护栏、重排序和评估。让 LLM 处理开放式推理和生成。
我可以在自己的硬件上运行 Decision 模型吗?
Jev 和 GLiDE 仅提供 API。GLiNER2.5-Decide、Laya、JevK5、OpenJev 和 kev 都有开源权重,可以本地运行。
Jev 的主要竞争对手是什么?
Fastino Labs 是最直接的商业竞争对手。它提供 GLiDE 作为托管 API,提供 GLiNER2.5-Decide 作为开源权重。
Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会公益服务。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻著称,内容既技术性强又通俗易懂。该平台每月浏览量超过 200 万次,证明了其在受众中的受欢迎程度。