Cloudflare 开源两款决策模型 Clef(27B)和 Clef-flash(9B),均为 Apache 2.0,兼容 Jev API,作者在 PDF 问答场景下做了对比测试。
如今大量 AI 调用其实并不需要真正写什么,它们只需要做选择:归入哪个类别、选哪段文字、是或否。
但我们大多数人仍在用对话模型来完成这些任务。我们花钱让它生成一段文字,然后再从中解析出我们需要的那一个词。
决策模型跳过了生成段落这一步。你把输入和允许的答案列表发过去,它会返回每个选项的概率。没有文字,一次推理完成。
我一直在用其中一个模型——TypeSafe 的 Jev(OpenRouter 上为 ~typesafe/jev-latest,当前版本 Jev 1.13)。我用它做一个小应用,给长 PDF 手册回答问题。在答案写出来之前,Jev 先选出最合适的段落。
然后在 10 月 1 日,Cloudflare 发了一篇博客宣布了 Clef:Introducing Clef: our open-source decision models, and new RL fine-tuning platform(blog.cloudflare.com)。实际上发布的是两个模型:
两者均为 Apache 2.0 协议,权重放在 Hugging Face(huggingface.co/Cloudflare/clef),均可在 Workers AI(developers.cloudflare.com)上运行。Cloudflare 称 Clef"完全兼容 Jev API",两者也都在 OpenRouter 上,名称为 cloudflare/clef 和 cloudflare/clef-flash(openrouter.ai)。
所以我在自己的应用之外分别测试了这两个模型,并将它们与 Jev 在准确率和速度上做了对比。
官方公告和模型卡做出了三个主要声明:
比 Jev 更快。Clef 中位延迟 209.3 ms,Jev 为 524.1 ms,Clef-flash 为 38.8 ms
大多数任务上持平或更好。例如 CLINC150 意图分类任务上 97.4% 对比 89.3%。在更难推理任务上 Jev 胜出,如 GPQA Diamond(78.3% 对比 48.0%)
概率经过校准。训练使用了 Brier 损失"来优化概率校准"
这三个数字都是 Cloudflare 在自己的硬件上测得的。Traictory 也指出了这一点:在自家基础设施上的延迟"是供应商最容易操控的指标"(traictory.com)。
我想看看通过 OpenRouter 调用时实际得到什么。
三个模型都走同一个 OpenRouter 端点,POST /api/alpha/decisions(OpenRouter 的 Jev 文档)。你发送一个 state(模型要看的内容)和 questions(它要做出的决策):
{
"model": "cloudflare/clef",
"state": {"message": "Tracking hasn't updated in five days."},
"questions": {
"intent": {
"type": "choice",
"instructions": "Which intent best describes the customer's request in state?",
"criteria": {
"billing": "Charges, invoices, refunds, payment methods, pricing",
"shipping": "Where a physical order is, delivery delays, returns of goods",
"bug": "Something in the product is broken or behaving wrongly"
}
}
}
}
返回的是选中的答案、每个选项的概率,以及一个置信度数字。
好用的地方在于:切换模型只需要改一个字符串。

两者给出了相同的答案。不过注意置信度,稍后会回头看它。
(本文中的终端交互是从真实会话重建的;数字来自实际运行。)
我故意把任务做得小而简单。三个任务:
intent:我自己写了 40 条短支持消息并手工标注,每个归入 6 个意图之一(billing、bug、account、feature、shipping、praise)。其中 10 条故意设计得很棘手,比如"Great app, but I was billed after my trial ended"
passage:30 个关于虚构公司的问题,从 10 段文字中选出能回答每个问题的那一段。其中 6 段是陷阱:目标公司的另外两段文字,以及三段关于其近胞胎公司的内容("Corvid Labs"对比"Corvid Systems")
passage_all:其中 12 个问题针对全部 120 段文字同时回答,每次请求约 4.7K tokens
为了保证计时的公平性:
我跑了两次。第一次是 Jev 对阵 Clef,然后稍晚一些让三个模型同场竞技。以下是第二次 run 的结果,所以三个模型面对的是同一时刻的同一网络:

Errors 列是 Clef 的情况:在每个任务中各有一轮调用因 HTTP 429 和 Workers AI 的"Capacity temporarily exceeded"而失败,计为错误。Clef 实际返回的每个答案都是正确的,只有一条例外。
那一条是所有模型都答错了的消息:"Is there a way to log in with Google?" 我标注的是 feature,三个模型都说是 account。老实说,如果今天再标一次,我可能会标得不一样。
所以在答案正确性上,Clef 与 Jev 打平。第一次 run 也是这个结论:Clef 为 39/40、30/30 和 12/12,而 Jev 为 38/40、30/30 和 12/12。
Clef-flash 则是另一种情况。
它的 5 个错误段落中,有 4 个是同一种错误:事实类型对了,但公司错了。问 Rowan Systems 卖什么,它回答的是 Rowan Labs 的内容。恰恰就是测试设计要捕捉的那种近胞胎陷阱。更大的模型一次都没掉进去。

两次 run 中,Jev 在每个任务上都是最快的。
Clef 在小请求上慢 1.7–2.4 倍,大请求上慢 3.4 倍,两次 run 结果一致。Clef-flash 落在中间:小请求上比 Jev 慢 1.2–1.3 倍,大请求上慢 2.2 倍。
这与 Cloudflare 图表显示的完全相反。他们测得 Clef 为 209 ms,Clef-flash 为 38.8 ms,Jev 为 524 ms。我从来没有看到任何一个 Clef 模型快过 Jev。
我的数字是从我的机器通过 OpenRouter 的完整往返时间,这才是你的应用看到的。他们的数字是在他们自己的环境测的。两者都可以为真,但只有一种是你们今天真正能得到的。
(第二次 run 整体更慢,包括 Jev 在内,所以要在同一轮 run 内部比较模型,不要跨 run 比较。)
Clef 的标价是每百万输入 tokens 0.24 美元,输出免费,与 Workers AI 上的价格相同(openrouter.ai、developers.cloudflare.com)。由于决策模型不写任何输出,这听起来很便宜。
Clef-flash 标价为 0.09 美元(openrouter.ai)。
与 Jev 相比都不算便宜。Jev 标价为每百万输入 tokens 0.042 美元,同样输出免费(openrouter.ai)。我响应中的 usage 字段与三个价格都吻合。注意到这一点的不是我一个人:The Register 和 Hacker News 在发布周就指出了同样的 6 倍差距(traictory.com)。
Clef 模型对相同文本计算的 token 数更少,但每 token 付费更高:Clef 约高 6 倍,Clef-flash 约高 2 倍。
摊到每次调用,Clef 比 Jev 贵 3.4–6 倍,Clef-flash 贵 1.3–2.3 倍。
公平地说:两次 run 加起来,410 次计费调用加上预热,总共花了大约 5 美分。在小规模下你感受不到差异。在每天一百万次调用时就会了。
这才是对我的应用真正重要的部分。
Jev 不只做选择。它还说出自己有多确定,而我用这个信息。如果最高票段落返回时置信度很低,这就是一个信号——手册可能根本没有回答这个问题。

Jev:正确时 0.99,错误时 0.71。差距明显。
Clef:正确时 0.81,错误时 0.74。几乎没有差距。而且在大任务上,它返回的每个答案都对了,同时说自己大约只有 41% 的把握。
Clef-flash 有意思。在意图任务上它的差距是三者中最大的:0.81 对比 0.43。但在大任务上情况反转了,正确时反而更不确定。
一个无论对错都相同的置信度数字,不是置信度,是噪音。
这就奇怪了,因为 Cloudflare 专门为校准训练过它。也许在大规模更难的数据集上会显示出效果。在我的数据上没有。
所以即使准确率相当,Clef 也不是任何依赖置信度动作的场景的即插即用替代品。而 Clef-flash 的置信度只有部分时候有用。
Clef 是一个真正的决策模型。在简单任务上选得和 Jev 一样好,开放权重是一个真正的加分项。
但今天在 OpenRouter 上,它更慢,输入越大越慢,每次调用成本更高,有时还会遇到容量不足,而且它的置信度没多大参考价值。
Clef-flash 在速度和价格上更接近 Jev。但仍然更慢,仍然更贵,而且会把长得像的名字搞混。
对我的应用来说,Jev 留下。一个月后我会再跑一次同样的测试。