微软在 Foundry 发布基于阿里 Qwen 构建的 Microsoft-Decision-1,选择自建决策模型。此前三天,OpenAI 刚将 Decisions API 向所有开发者公开开放。
很高兴你来到这里。每周一到周五,TNS 最精彩的内容都会送达,帮助你紧跟新闻动态,在工作中保持领先。
请查看收件箱中的确认邮件,你可以在邮件中调整偏好设置,也可以加入更多群组。
在你喜欢的社交媒体平台上关注 TNS。
在 LinkedIn 上关注 TNS。
等待第一封 TNS newsletter 的同时,不妨看看最新的精选文章和热门报道。
Microsoft 于周五在 Foundry 上推出了 Microsoft-Decision-1。三天前,OpenAI 刚刚以公开 beta 的形式向所有开发者开放 Decisions API。Microsoft 选择在 Alibaba 的 Qwen3.5-9B 上对这个决策模型进行后训练,而没有采用合作伙伴 OpenAI 构建的模型。不过,Microsoft 计划很快也以自家的 MAI 模型和 OpenAI 的模型为基础,重新训练它。
Decision-1 的价格为每百万输入 token 0.042 美元,输出免费,与 TypeSafe 的 Jev 定价完全一致。同一天,TypeSafe 宣布完成由 a16z 领投的 8.7 亿美元 A 轮融资,估值达到 75 亿美元。
Microsoft 比开创这一品类的那家初创公司晚了大约三周半。在这段时间里,OpenAI、Upstage、Perplexity、Cloudflare 和 AWS 都已经推出了自己的决策模型。
TypeSafe 表示,《财富》500 强中已有近 30% 的公司试用过 Jev,不过它没有公布任何一家公司的名字。TypeSafe CEO Diogo Almeida 在 X 上发帖称,上线三周以来,“《财富》500 强中的 29.4% 都来了”。
发布了一个模型,无意间每天提供了数万亿 token 的服务,《财富》500 强中的 29.4% 都来了,还从 @a16z 拿到了一笔巨额 A 轮融资。才过去三周,我们现在想睡觉了。pic.twitter.com/skpaLPd2Bz — Diogo Almeida (@CompleteSkeptic),2026 年 10 月 9 日
发布了一个模型,无意间每天提供了数万亿 token 的服务,《财富》500 强中的 29.4% 都来了,还从 @a16z 拿到了一笔巨额 A 轮融资。才过去三周,我们现在想睡觉了。pic.twitter.com/skpaLPd2Bz
这些公司也正是 Microsoft 销售 Azure 的目标客户,因此,TypeSafe 早期获得的市场吸引力让 Microsoft 很难忽视。
Microsoft 董事长兼 CEO Satya Nadella 于周五在 X 上宣布了这个模型,并写道:“我们已经在 Microsoft 内部开展测试。”四个内部团队的实践印证了他的说法。
介绍一下 Microsoft-Decision-1,这是我们用于快速决策的新模型。它在结构化决策任务中表现出色,在延迟和质量方面都超过了 LLM 和其他决策模型。我们已经在 Microsoft 内部测试它,用于从事件……等各种场景。pic.twitter.com/M3fAOD90r6 — Satya Nadella (@satyanadella),2026 年 10 月 9 日
介绍一下 Microsoft-Decision-1,这是我们用于快速决策的新模型。它在结构化决策任务中表现出色,在延迟和质量方面都超过了 LLM 和其他决策模型。我们已经在 Microsoft 内部测试它,用于从事件……等各种场景。pic.twitter.com/M3fAOD90r6
Xbox Research 用它整理了超过 10,000 条玩家反馈;Copilot 团队用它评估聊天和 Agent 的回答;值班工程师用它在处理实时故障时提取上下文;Microsoft Discovery 则用它在 Agent 重新规划之前为实验评分。
Microsoft 公布的数据显示,在 Xbox 的应用场景中,它的速度超过 GPT-6 Sol 的 14 倍,成本却只是后者的一小部分;在 Discovery 中,它的一致性达到对比对象的 46 倍。
不过,这个模型可能还肩负着更大的任务。周三,Microsoft 表示,GitHub Copilot 很快就会决定哪些任务在设备本地运行,哪些任务发送给云端的大规模模型,不过它尚未披露 Copilot 会向云端发送哪些内容。
模型路由是 Microsoft 列出的 Decision-1 用例之一,但公司尚未说明,是否会由这个模型为 Copilot 做出这些决定。Copilot、GitHub 和 Xbox 都需要做路由决策,因此 Microsoft 有动力在内部处理这些工作。
Copilot、GitHub 和 Xbox 都需要做路由决策,因此 Microsoft 有动力在内部处理这些工作。
Cognition 工程副总裁 Jared Palmer 花了大约 95 美元的 Modal H100 算力费用,就把自己的开源 Kev 模型迁移到了 Qwen3.5。Cloudflare 也选择了与 Microsoft 相同的 Qwen3.5-9B 基础模型,构建了 Clef-flash。
Jev 的价格正在成为市场通行价:Palmer 在 OpenRouter 上为 Kev-4B 标出的价格是每百万输入 token 0.042 美元,Perplexity 收费 0.02 美元,而 OpenAI 的收费超过 Jev 的两倍。在这样的价格下,单次决策调用带来的收入微乎其微。对 Microsoft 来说,更大的机会是让 Agent 流量持续通过 Foundry,包括每次决策前后的生成式模型调用。此外,在 OpenRouter 上架也可能把尚未使用 Azure 的开发者带入这个生态。
Microsoft CTO 办公室的软件工程副总裁 Achint Srivastava 在介绍 Decision-1 时表示,它能让现有应用、Agent 和工作流“在安全、可信的环境中”获得决策能力。
这也体现了 Decision-1 相比竞争对手的不足。Foundry 上的产品页面显示,它最多接受 32,768 个文本 token,并返回 JSON,但不支持图像。OpenAI 的 Decisions API 和 Cloudflare 的 Clef 则支持图像,其中 Clef 使用了 vision encoder。
Cloudflare 已经以 Apache 2.0 许可证发布了 Clef,而 Microsoft 尚未宣布开放模型权重。AWS、Upstage 和 Ollama 也都采用了 TypeSafe 的 System One API,这个 API 如今已成为这一品类的通用接口。不过,Microsoft 尚未说明 Decision-1 是否完全兼容它,尽管 Foundry 示例代码调用的是一个 /systemone endpoint。
Microsoft 表示,Decision-1 输出的概率经过校准,也就是说,在具有代表性的案例中,预测概率为 90% 的结果,应该每 10 次有大约 9 次正确。但针对 Jev 的研究表明,当输入被刻意编写来误导模型时,看似有把握的评分可能出现很大的偏差。Microsoft 自己的 Foundry 文档也建议客户使用自己的数据验证校准效果。
Microsoft 表示,Decision-1 输出的概率经过校准,也就是说,在具有代表性的案例中,预测概率为 90% 的结果,应该每 10 次有大约 9 次正确。
在 JevOut 预印本中,USC 计算机科学研究员 Zixiang Xu 及其合作者发现,只需在上下文中加入简短、听起来很自然的内容,就能让 Jev 最初正确的 508 个决策中有 312 个发生翻转。在其中 229 个案例中,Jev 给错误答案分配了至少 70% 的概率。在相同的测试方法下,另外三个评分系统的决策翻转率介于 64.9% 和 73.2% 之间。
Microsoft 使用八种扰动测试了 Decision-1,包括重新排列选项顺序、改写描述等,平均有 1.3% 的答案发生变化。JevOut 没有测试 Decision-1,因此尚不清楚这个模型面对类似攻击时会有怎样的表现。Microsoft 也尚未确认 Decision-1 是否完全支持竞争对手采用的 System One API,因此,它的互操作性以及置信度评分究竟值得多大程度的信任,仍然存在疑问。