Jev跳过文本生成直接返回类型化决策,含校准概率,输入$0.042/百万token输出免费。实测涵盖模型路由、工具调用门控、重排、注入筛查等20个场景。
Artificial Intelligence
上周,TypeSafe AI 发布了 Jev,这是其首款 System One 模型。创始人 Diogo Almeida 此前在 OpenAI 工作,从事 ChatGPT 背后指令遵循方面的研究。
Jev 不聊天、不写代码、不做总结。它接收非结构化状态,返回带校准概率的类型化决策。这使其成为 Agent 循环中数千个小判断的自然选择:调用哪个模型、某条命令是否安全、哪段文本相关、Agent 是否真正完成。
每次调用发送一个状态(文本或 JSON)加上一组类型化问题。TypeSafe 的文档定义了 3 种原语:
Choice 从列表中选择一个选项,返回每个选项的概率及置信度。
Score 按有序的评分标准对状态评级,返回概率及置信度。
Noul 返回某条陈述为真的概率(0 到 1)。
所有问题在同一次请求中针对同一状态并行评估。TypeSafe 使用 RLCD(Reinforcement Learning for Calibrated Decisions)训练 Jev,因此更高的置信度应该对应更高的准确率。Choice 支持最多 255 个选项。
主要宣称——193.6 倍更快、444.6 倍更便宜——来自 TypeSafe 自身的流程评估。发布博文称这些数字处于现实世界收益的较高区间,以 GPT-6 Astra 和 Fable 5.1 作为参考答案。
Interactive Explainer
将逐 token 的 LLM 与 Jev 的单次通过竞速,移动置信度阈值查看代码如何控制每个决策,估计月度成本,并浏览全部 20 个用例。
Jev 的 20 个代理用例
路由与编排
模型路由:对请求难度评分,然后将其发送给快模型或强模型。LangChain 以 ModelRouterMiddleware 形式集成了这一功能;jev-router 为 Claude Code 和 Codex 每轮调用一次。
技能选择:TypeSafe 的技能建议 cookbook 从 Nous Research 的 Hermes 目录中 182 个技能中最多选出一个,使用 2 次请求。
类型化函数调用:函数调用 cookbook 将自然语言交易请求映射到函数名和封闭集参数,由置信度门控。
工单分类与意图路由:一次调用返回部门、沮丧程度和紧急性。意图路由模式将每个请求发送到确定性逻辑、专家 LLM 或人工。
安全与护栏
工具调用风险门控:pi-warden 询问待执行的 bash、write 或 edit 是否不可逆或偏离任务。它在 "reset the database" 之后告诉 db:reset,但在 "add a column" 之后不会。LangChain 的 AutoModeMiddleware 对有风险的调用返回错误。
只读自动批准:jev-auto-approve 是一个 Claude Code hook,仅在 p ≥ 0.95 时自动批准,在其发布的校准中批准了 0/8 个状态变更命令。
密钥泄露防护:jev-secret-guard 将掩码字符串发送给 Jev,在其校准中阻止了 6/6 个密钥和 0/6 个良性字符串。
提示词注入筛查:在 TypeSafe 的 RAG 段落 cookbook 中,余弦相似度将植入的注入排在第一位(0.584),Jev 给它打分为 0.99 并将其剔除。
LLM 输入输出护栏:护栏 cookbook 设置危害概率阈值,对每条消息执行通过、审核、阻止或路由。
检索与 grounding
重排序:在 40 个 CLERC 法律查询上,重排序 cookbook 将 top-1 准确率从 5% 提升到 18%,top-10 从 38% 提升到 62%。
引用验证:引用检查 cookbook 使用一次 Choice 决策某段来源是否支持、反驳或未涉及某主张。
计算机、浏览器与实时控制
浏览器代理:Browser Use 的 Jev Ultrafast 在一次请求中选择操作和 DOM 元素,完成一次 Google Flights 搜索约需 7.1 秒。
桌面计算机使用:typesafe-computer-use 对 macOS 屏幕进行 OCR,让 Jev 分类下一个动作,每步约 $0.0002。
移动代理:Mobile Jev 决策每次 Android 点击,约 21 秒 9 步到达 Uber 支付屏幕。
实时游戏代理:TypeSafe 的 Doom 演示以每秒约 10 次查询的速度运行,约 $7/小时,基于结构化游戏状态。
Agent 质量与记忆
循环停滞检测:ProgressGate 评判轨迹,代码返回 CONTINUE、WARN、REPLAN 或 HALT。
"完成"声明验证:jev-belay 在信任 Claude Code Agent 的 "done" 声明前检查转录中的证据。
上下文压缩:fast-jev-compaction 对工具调用评分并丢弃过时的,而不是总结上下文。
轨迹挖掘用于记忆:Asymptote Labs 的 Beacon 使用 Jev 找出 Claude Code、Codex、Cursor 和 OpenCode 中哪些运行值得转化为可复用技能。
语义检查:jev-lint 在编辑时为 Claude Code 和 Codex 标记违反团队规则的情况。
Jev 与最接近的竞品
| 特性 | Jev 1.13 (TypeSafe) | Laya (开源) | kev (开源) | Claude Opus 5 (LLM) |
|---|---|---|---|---|
| 模型类型 | System One 决策模型 | Encoder 决策模型 (ModernBERT-large) | LoRA + readout head on Qwen2.5-0.5B | 生成式 LLM |
| 权重/许可证 | 闭源,托管 API | Apache 2.0,421M 和 322M 参数 | Apache-2.0(基础模型使用 Qwen 许可证) | 闭源,托管 API |
| Choice / Score / Noul | 是 | 是 | 是 | 通过结构化 prompting/v1/systemone 兼容 原生 |
| 输出保证 | Schema 绑定,无类型错误 | 对声明选项的类型化回答 | 对声明选项的类型化回答 | OpenRouter 测试中 3080 个里有 0 个无效 |
| 校准 | RLCD 训练的置信度 | 返回置信度 | 留出 ECE 0.065 | 提示估计,不保证校准 |
| 最大 Choice 选项数 | 255 | 超过 50 质量下降 | 255 | 不适用 |
| 延迟 | 70–500 ms(厂商);OpenRouter 中位数 175 ms | 单问题 32.8 ms,本地(自报) | 6 问题 160 ms,本地(自报) | OpenRouter 中位数 2266 ms |
| Banking77 准确率 | 81.0%(OpenRouter) | 84.4%(OpenRouter) | 不可比(默认 0.425,自有测试框架) | 77 路 0.860(自有留出集) |
| 价格 | $0.042/MTok 输入,输出免费 | 免费,自托管 | 免费,自托管 | 每次请求 $2.42 vs Jev $0.11(OpenRouter) |
| 部署 | TypeSafe、Vercel AI Gateway、OpenRouter | pip,本地 CPU 或 GPU | 本地服务器 | API |
开源模型的数字由各项目在其自有测试框架上自报,因此将其视为方向性参考。OpenRouter 的 Banking77 测试是最干净的头对头:Jev 比 Claude Opus 5 低 3.3 个百分点,中位数延迟快 13 倍,成本约为 1/22。
Jev 返回类型化的 Choice、Score 和 Noul 回答及概率,绝不生成自由文本。
TypeSafe 列出价格为每百万输入 token $0.042,输出 token 免费,延迟 70 到 500 ms。
最适合 Agent 的场景:路由、工具调用门控、重排序、引用检查和注入筛查。
在 Banking77 上,Jev 得分为 81.0%,Claude Opus 5 为 84.4%,中位数延迟低 13 倍。
Schema 安全不等于正确:先在自己的流量上校准阈值。
什么是 Jev?Jev 是 TypeSafe AI 的首款 System One 模型。它返回类型化的 Choice、Score 和 Noul 回答及概率,而非生成文本。
Jev 是 LLM 的替代品吗?不是。它位于 LLM 旁边。LLM 负责规划和写作;Jev 处理路由、门控和验证等有界决策。
Jev 多少钱?TypeSafe 列出每百万输入 token $0.042,输出 token 免费。
我能在本地运行 Jev 吗?不能运行 TypeSafe 的模型。Laya 和 kev 等开源项目在你自己的硬件上实现了相同的 /v1/systemone 接口。
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最新的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻著称,内容既技术严谨又易于被广大受众所理解。该平台每月浏览量超过 200 万次,展示了其在受众中的受欢迎程度。