AWS 基于 Qwen3.5-2B 构建的开源决策模型,JevBench 得分 0.723,RTX 3090 上推理仅需 115ms,Apache-2.0 开源。
AWS Strands Labs 发布 Strands Decider 2B:一款开源决策模型,决策耗时约 115 ms
来源:MarkTechPost
人工智能
AWS Strands Labs 发布了一款名为 Strands Decider 2B 的开源决策模型。它不生成文本,只读取状态和带类型的问题,然后返回选择结果、yes/no 概率或带校准置信度的评分。该模型有 19 亿参数,可在本地 CPU、消费级 GPU 或 Apple 硅 Mac 上运行。
能否部署?可以,用于本地和自托管场景。权重托管在 Hugging Face,采用 Apache-2.0 许可证,pip install strands-decider 即可获得 CLI 和 HTTP 服务器。捆绑的服务器绑定在 127.0.0.1 且无认证,因此生产环境需要自行加一层认证。目前没有托管推理服务商提供该模型。
决策模型,也称 System One 模型,是 TypeSafe AI 于上月发布 Jev 之后才成为一个独立类别的。LLM 可以产生任意输出,而决策模型只在给定选项中做选择或给出评分。
Strands Decider 支持 3 种问题类型:
每个答案均来自允许的选项并附带置信度。该团队表示,在复杂问题上该模型不如推理模型。它不适用于编码、对话或摘要任务。
团队从 Qwen3.5-2B-Base 出发,去掉了语言建模头,用一个约 100 万参数的小型指针头(pointer head)取而代之。该头将 <answer> 位置的隐藏状态与每个选项最后一个 token 的隐藏状态进行比较。一次前向传播即得出结果,无需解码循环。
主体部分采用 rank-16 LoRA,指针头以 fp32 运行。标签集来自请求,因此选项数量不受限制。发布的检查点版本为 v19。
围绕同一文本提多个问题成本很低:状态只读取一次,每个额外问题只增加其自身的 token。
团队在 JevBench 公开集上测量了准确率和校准度——JevBench 是 Jev 类模型的第三方基准测试。已发布的 v19 数据如下:
在 9 月 25 日的 v1.4.2 榜单上,v19 在 2B 类别 33 个模型中排名第 3。排除 3 个刚刚超过 2B 的模型后,在 30 个模型中排名第 1。repo 同时标注了一个注意事项:Mapika 较新的 decider-2b v11 在 Strands 测试框架上得分为 231 题中答对 175 题,领先 8 题。撰写本文时,Strands Decider 尚未登上更新的 v1.5.4 综合榜单。
校准度是实际的亮点。在未见过的短文本分类任务中,置信度在 0.9 及以上的答案正确率约为 95%。团队建议在阈值以下时进行确认或升级。
| 功能 | Strands Decider 2B (v19) | Jev 1.13.0 | decider-2b Decision 2B |
|---|---|---|---|
| 开发者 | Strands Agents (AWS) | TypeSafe AI | Mapika |
| 访问方式 | 开放权重,Apache-2.0 | 闭源托管 API | 开放代码或权重 |
| 基座模型 | Qwen3.5-2B-Base + LoRA + pointer head | 未公开 | Qwen3.5-2B-Base + trained readout |
| 参数量 | 1.9B | 未公开 | 1.9B |
| 自托管 | 支持 | 不支持 | 支持 |
| 完整训练配方与数据列表已发布 | 是 | 否 | 未验证 |
| JevBench 公开准确率(v1.4.2 榜单) | 0.723 | 未出现在榜单中 | 0.710 |
| 报告延迟 | 115 ms 中位数(RTX 3090) | 70–500 ms(厂商数据) | 未比较 |
来源:Strands JevBench 对比、Benchmark Heaven JevBench、Jev 产品页。延迟数据来自不同硬件和测试框架,不可直接比较。
团队报告了早期成功案例,涵盖模型路由、工具选择、参数检查、分诊、护栏、评估和混合 agent。在混合 agent 中,LLM 处理困难决策,决策模型处理例行决策。
repo 中的示例在一个 Strands agent 内部对天气工具调用加了护栏。before_tool_call 干预会提出 2 个 yes/no 问题:参数是否基于用户表述?此时调用是否为时尚早?如果 agent 猜了一个城市,它会转而询问用户。
在 CLI 中,将"Help! My payouts have been failing for 3 days!"路由到 billing、sales 和 retail returns billing,置信度为 0.768。
Strands Decider 2B 返回选项、yes/no 和评分,绝不生成文本。
它将 Qwen3.5-2B 的 LM head 替换为约 1M 参数的 pointer head。
v19 在 JevBench 公开集上得分为 0.723,ECE 为 0.052。
在 RTX 3090 上中位数延迟为 115 ms。
权重、代码、数据列表和训练配方均以 Apache-2.0 发布。
点击查看技术细节、GitHub 仓库和模型权重。所有荣誉归该项目的研究人员所有。同时欢迎关注我们的 Twitter,并不要忘记加入我们的 15 万+ ML SubReddit 和订阅我们的通讯。你用 telegram 吗?现在也可以加入我们了。
想与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会吗?请联系我们。
Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台专注于深入报道机器学习和深度学习新闻,既具有技术深度又易于被广大受众所理解。该平台月浏览量超过 200 万次,彰显了其受欢迎程度。