TypeSafe AI 推出决策模型 Jev,输入任意结构化状态,输出浮点数、分类或置信度,仅 0.042 美元/百万 token,远低于 GPT-5 Nano,适合大量调用的生产场景。
上周,TypeSafe AI 发布了 Jev,这是他们推出的一个新类别模型的第一个示例,他们称之为"System One 模型"(我认同 Maggie Appleton 的观点,"decision models"(决策模型)是个更好的名字)。Jev 是对常规 LLM 格式的一个有趣变体:它仍然接受文本输入,但输出不是文本,而是对应于类别、是/否问题、评分以及相关置信度分数的浮点数。
TypeSafe 对 Jev 的描述如下:
Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.
把它想象成前沿智能的 function call:无结构的状态输入,类型化的概率决策输出。
它也非常快,而且非常便宜。常规 LLM 按输入和输出 token 计费,输出通常收费显著更高。Jev 只对输入收费——输出免费——其首个模型的输入价格为每百万 token 0.042 美元——甚至比 OpenAI 的 GPT-5 Nano(0.05 美元/百万)还便宜。
Jev 让你可以对文本或半结构化数据提问。你需要组合一个"state"对象,包含字符串、字符串数组或键值对集合——这可以描述一篇文章、一个客户或任何其他类型的记录。然后你将其连同一个或多个问题一起发送到他们的 API,会为每个问题返回一个回复。
你可以问三种类型的问题:
是/否问题,Jev 称之为"Noul"问题——他们的 CEO 在 Hacker News 上确认这是 Bernoulli(伯努利)的缩写,来自伯努利分布。你提出一个陈述,会得到一个 0 到 1 之间的浮点数,表示模型对该陈述为真的置信度。
选择问题,模型从提供的选项集中选择一个——实际上是一个置信度分数加上所有选项的概率分布。
评分问题,你提供一组带有描述的数值级别,模型会在这个范围内提供一个浮点分数。
Jev API 可以接受单个文档("state")和尽可能多的问题(塞进上下文窗口即可)。问题是并行评估的,因此发送多个问题所需的时间与发送单个问题相近。
我认为"决策模型"这个框架有助于理解在哪里使用 Jev。它非常适合任何可以表达为分类任务的事项——想想垃圾邮件检测、标签建议、优先级排序和排名。
我也一直在尝试用它做搜索重排序:用 BM25 等廉价算法获取 100 个可能的匹配项,然后用 Jev 针对原始查询对这 100 个候选进行相关性评分。
Jev 让我感到有些不安的一点是,它代表了进一步倒退到黑盒机器学习系统。
LLM 已经是黑盒了——你可以让它们解释它们的决策,但你无法保证它们所说的有用或准确。
Jev 甚至不给你那个:输入你想要的全部文本,你唯一会得到的就是一个浮点数。如果 Jev 标记某内容为垃圾邮件,是哪些内容特征触发了它?
这也意味着对偏见的担忧应该是首要考虑。我真的希望没有人会用 Jev 来排名求职者——那个浮点数可能隐藏着模型中嵌入的各种看不见的偏见,而通过实验来挑选出那种偏见将是一件棘手的事情。
(我尝试了一个实验,让 Jev 对旧金山湾区每个城市就打分是/否"好城市?"——它把库比蒂诺排第一,东帕洛阿尔托排最后。嗯。)
在实践中,这一切意味着评估和结构化实验比常规 LLM 项目更加重要。谢天谢地,Jev 非常便宜,以至于运行数百甚至数千个实验性提示只需要几美分。
在过去几天里,看着更广泛的社区想出 Jev 的潜在用例真的很有趣。以下是我注意到的一些创意用例:
jevchat by Kyle Pena 将 Jev 变成了一个(糟糕的)聊天模型。"每一步它都问 Jev 一个问题:给定用户的问题和迄今为止写的回复,下一个符号是什么?"。ericpruitt 在 Hacker News 上写道:"它是 Morty 与死亡水晶对话的数字等价物"。
jev-leftpad by Fatih Kadir Akın 用提示"How many spaces are needed before value to reach targetLength?"和一个允许从"0 spaces are needed"到"10 spaces are needed"的选择查询实现了 left-pad。
jev-2048 by Andy Gayton 使用 Jev 来玩 2048 滑块拼图游戏。
也有一波尝试在开源权重模型之上创建类似 Jev 的模型的项目。Kev 是一个有趣的例子,使用 Qwen 3.5 生成了 0.8B、4B 和 9B 模型。以下是配套的 Hacker News 讨论串,有人链接到了一个 JevBench 基准测试,已经出现用于比较"Jev 类决策模型"。
考虑到 Jev 才发布不到一周,围绕它的活动量非常惊人。
Generating running routes with GPT-6 Astra and ChatGPT Work - 2026 年 9 月 12 日
OpenAI agents back in May 攻击了 RubyGems - 2026 年 9 月 12 日
This is Jev introduces a new shape of LLM—System One, aka Decision Models by Simon Willison, posted on 21st September 2026.
Previous: Generating running routes with GPT-6 Astra and ChatGPT Work
Sponsor me for $10/month and get a curated email digest of the month's most important LLM developments.
Pay me to send you less!