Microsoft-Decision-1基于Qwen3.5-9B后训练,针对固定答案选项返回校准概率,而非生成文本。模型面向路由、分类、验证和Agent控制,已提供Foundry与OpenRouter访问渠道。
人工智能
Microsoft 发布了 Microsoft-Decision-1,这是一款用于路由、分类、验证和 Agent 控制的决策模型。Microsoft-Decision-1 是一种决策评分模型,它为每个固定答案选项返回经过校准的概率,而不是生成文本。该模型基于 Alibaba 的 Qwen3.5-9B 进行后训练,目前已在 Microsoft Foundry 和 OpenRouter 上提供。
规模:基于 Qwen3.5-9B 构建,未披露确切参数量。上下文窗口为 32,768 tokens。
运行方式:仅提供托管 API(Microsoft Foundry,以及通过 Azure 提供服务的 OpenRouter)。不开放权重,没有量化版本,未披露硬件配置。
性能:在 Microsoft 的 36 项基准测试对比中,平均准确率最高,p50 延迟为 85 ms。
最佳表现:36 项基准测试的平均准确率为 83.5%,领先于 Quyet-1.0-Large 的 81.9%。
较弱表现:校准得分为 92.2,位居第二,低于 Quyet-1.0-Large 的 93.1。仅支持文本,不提供解释。
总体评价:最大的优点是决策速度快、成本低,且概率经过校准,输入价格为每百万 tokens $0.042,输出免费。最大的缺点是权重不开放,且所有基准测试均由厂商自行开展。
最大的优点是决策速度快、成本低,且概率经过校准,输入价格为每百万 tokens $0.042,输出免费。最大的缺点是权重不开放,且所有基准测试均由厂商自行开展。
最大的缺点是权重不开放,且所有基准测试均由厂商自行开展。
决策模型读取输入,并为一组封闭选项评分。它不生成文章或其他自然语言文本。Microsoft 将决策模型定位为一个新的 AI 类别,专门生成软件可以立即据此执行操作的输出。
Microsoft 对 Qwen3.5-9B 进行了后训练,使其能够在单次处理中完成决策评分。给定情境、问题和固定选项,模型只需一次调用,就能返回每个选项的概率。Microsoft 计划让未来版本改用 MAI 和 OpenAI 模型作为基础。
Foundry 的模型卡列出了支持的格式:
训练使用了 Microsoft Open Data 流程下的公开数据集,以及合成数据。输出格式为 JSON。OpenRouter 指出,模型权重会持续更新,但 API 结构保持不变。
Microsoft 在 36 项基准测试、共 147,137 道问题上对比了 9 个系统。训练过程未接触这些基准测试。Microsoft-Decision-1 以 83.5% 的平均准确率位居第一。
它的 p50 延迟为 85 ms,p95 延迟为 125 ms。其速度是 Quyet-1.0-Large 的 4.5 倍,是 GPT-6 Sol 的 35 倍;后者耗时 3.01 s。
Microsoft 还测试了鲁棒性。它对每个请求施加 8 种扰动,包括改写措辞和打乱选项顺序。模型平均在 1.3% 的扰动中改变了决策。当扰动仅涉及改写选项、反转选项顺序或打乱选项顺序时,决策改变率为零。
在安全性方面,Microsoft 在 11 项基准测试中运行了 5,250 个请求,涵盖有害内容、越狱和 prompt injection。Microsoft 表示,模型能够正确拒绝不当请求,同时保留较高的实用性,但没有公布具体得分。
| 特性 | Microsoft-Decision-1 | Quyet-1.0-Large | H2O-Lightning-4B | GPT-6 Luna Decisions |
|---|---|---|---|---|
| 开发者 | Microsoft | Chinh Nguyen | H2O.ai | OpenAI |
| 基础模型 | Qwen3.5-9B | Gemma-4-31B-it(已合并 LoRA) | Qwen3.5-4B | 未披露 |
| 参数量 | 未披露 | 31.3B | 4B | 未披露 |
| 上下文 / 输入 | 32,768 tokens | 8,000-token prompt(6,000 用于状态) | 40,960(vLLM 服务配置) | 未披露 |
| 许可证 | 专有 API | Apache-2.0 | Apache-2.0 | 专有 API |
| 模态 | 文本 | 文本 | 文本和图像 | 文本和图像 |
| 硬件 | 托管(Azure) | 1 张 80 GB GPU,bf16 | 已在 32 GB GPU 上测试;权重大小为 9.1 GB | 托管 |
| 准确率(Microsoft,36 项基准测试) | 83.5% | 81.9% | 77.2% | 79.4% |
| 校准得分(Microsoft) | 92.2 | 93.1 | 91.8 | 89.9 |
| Microsoft 图表中的延迟中位数 | 85 ms | 380 ms | 210 ms | 300 ms |
| 价格 | 输入每百万 tokens $0.042,输出免费 | 自托管 | 自托管 | 输入每百万 tokens $0.10,输出免费 |
准确率、校准得分和延迟数据均来自 Microsoft 的图表。其中,竞品的延迟使用的是 JevBench v1.6.1 调整后的中位数。
并不完全一致。Microsoft 通过 Foundry 测量自家模型的延迟。竞品数据则采用 JevBench 调整后的中位数,而非原始测量时间。
H2O.ai 的模型卡对此提出了异议。模型卡指出,JevBench 的调整方法会将实测时间翻倍,再加上 0.15 s。H2O 表示,其模型实测延迟中位数为 29 ms,而不是 210 ms。Microsoft-Decision-1 尚未出现在 JevBench 榜单上。在该榜单的官方综合评分中,H2O-Lightning-4B 以 72.5 分排名第 1。
开发者可以通过 Microsoft Foundry 调用该模型,它以正式可用的“Direct from Azure”模型形式提供。在 OpenRouter 上,它使用 Decisions API,而不是 chat endpoint。Chat completions SDKs 无法用于调用它。
价格为每百万输入 tokens $0.042,输出免费。OpenAI 的 Luna decisions endpoint 收费为每百万输入 tokens $0.10。
模型卡明确列出了以下限制:
Microsoft-Decision-1 为固定选项输出经过校准的概率评分,而不是文本。
它基于 Qwen3.5-9B 进行后训练,上下文窗口为 32,768 tokens。
在 Microsoft 的 36 项基准测试对比中,它以 83.5% 的准确率和 85 ms 的 p50 延迟领先。
每百万输入 tokens 的费用为 $0.042,输出 tokens 免费。
延迟对比存在争议,独立的 JevBench 测试结果尚待公布。
欢迎查看官方公告、Foundry 模型卡和 OpenRouter 模型页面。本项目的全部功劳归于项目研究者。此外,欢迎在 Twitter 上关注我们,别忘了加入我们拥有 150k+ 成员的 ML SubReddit,并订阅我们的 Newsletter。等等!你在用 Telegram 吗?现在也可以在 Telegram 上加入我们。
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一名富有远见的创业者和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近推出了人工智能媒体平台 Marktechpost。该平台深入报道机器学习和深度学习新闻,兼顾技术准确性与易读性,让广泛的读者都能理解。平台每月浏览量超过 200 万,体现了它在读者中的受欢迎程度。