企业AI需求多样,需根据隐私、延迟、成本、质量和风险差异选择模型;开源模型提供控制权,前沿API提供先进推理能力,实用方案是两者结合。
一个业务场景中不会只有一种 AI 任务,而是会有大量小型决策,它们各有不同的隐私、延迟、成本、质量和风险要求。
这使得模型选择本质上是一个路由问题,而不是品牌之争。开源权重模型让团队可以掌控执行和适配过程。而受管理的 frontier API 则提供高级推理能力和工具支持,无需承担基础设施负担。
实用的技术栈会同时用好两者。
开源权重模型将训练好的参数以声明许可证的形式开放下载。团队可以根据模型大小和硬件条件,在工作站、私有服务器、云账户或专业托管平台上运行。
目前可用的生态已经相当广泛。Qwen3 官方仓库记录了通过 llama.cpp、Ollama、LM Studio 等工具进行本地执行的方法,以及使用 vLLM 和 SGLang 进行更大规模部署的方案。DeepSeek-V3 公布了模型权重、本地部署指南和支持商业使用的许可证。OpenAI 的 gpt-oss 文档描述了那些设计为在用户控制的基础设施上运行的模型。
这种控制力带来了灵活性,也带来了工作量。需要有人选择运行时、配置算力、打补丁依赖、保障访问安全、监控性能、管理升级,以及决定哪个模型构建版本可以投入生产。
闭源模型则通过提供商的产品或 API 访问。提供商负责运营模型基础设施,通常还会提供托管式扩展、模型更新、安全控制和开发者工具。客户按使用量付费,在提供商的服务边界内工作。
当前的 API 文档说明了为什么这些模型在困难任务上仍然有用。Anthropic 的思考指南描述了复杂问题及工具结果上的推理过程。OpenAI 的模型指南按能力、成本和工作负载将模型和推理设置进行了区分。
工作流决定了每种交付模式各自的适用场景。
在选择模型之前,先把工作流拆解成步骤,针对每个步骤问五个问题。
从数据分类开始。
如果某个步骤要处理原始员工记录、私有源代码、客户标识符或未发布的财务数据,可能需要在组织控制的基础设施内运行。正确配置模型、运行时和周边工具后,本地执行可以将这些内容保留在定义好的环境内。
隐私保护仍然取决于周边系统。日志、向量数据库、临时文件、模型服务器和监控工具都可能泄露数据。本地执行让团队掌控这条边界,并承担执行它的责任。
对于允许离开环境的数据,受管 API 可能就够用。在使用前要审查提供商的保留策略、数据驻留、训练使用条款以及具体服务层的合同条款。"闭源模型"这个标签太宽泛,不能作为数据策略的依据。
开源权重模型适合输入稳定、输出可测试的重复性工作。
例如:
这类任务可以用具有代表性的测试集来评估。当一个更小的自托管模型达到所需精度后,把每个样本都发送给能力最强的外部模型只会增加成本,而不会改善业务结果。
当本地模型已经加载完成且离应用很近时,可以快速响应。但它也可能闲置在昂贵的硬件上,或在流量超过可用容量时变慢。
API 可以吸收不均匀的请求量,无需客户维护备用算力。网络延迟、速率限制和提供商的可用性会成为设计的一部分。
计算完整的运营成本。对于开源权重,要包含硬件、托管、存储、工程时间、监控和空闲容量。对于 API,要包含输入、输出、缓存、工具调用和重试成本。在预期吞吐量下比较每个被接受任务的成本。
OpenAI 的 gpt-oss 指南明确说明了这种权衡:模型权重可以下载,无需 API 费用,但用户仍需负责算力、存储和托管成本。
开源权重允许更深入的适配。团队可以选择量化方式、调优模型、约束服务环境、检查周边代码,并让经过测试的版本保持稳定。
在制造业、受监管的运营、断网环境以及需要在一个长发布周期内保持可预测行为的产品中,这些都很重要。
受管 API 减少了运营负担。它们可以通过一个接口提供成熟的工具调用、多模态输入、结构化输出和更强的通用推理。但版本锁定和回归测试仍然重要,因为提供商的模型和平台功能都在演进。
错误成本应该决定最终路由。
一个弱的分类可以重试或进入队列。但一个错误的法律解读、信用推荐或高管声明可能造成实质性损害。
无论使用哪种模型,高风险步骤都需要更强的评估、支持证据和人工审批。Frontier 推理可以提高模糊分析的 quality。责任仍然由组织承担。
在需要人工负责决策的情况下,对于判断密集型步骤使用通过测试的最佳表现选项。
以一家公司分析数千条客服对话来决定哪些产品问题值得重点关注为例。
第一阶段包含私有客户文本和大量重复性工作。本地开源权重模型可以移除个人标识符、检测语言、将每条对话按产品分类体系分类,并拒绝信息量不足的记录。
第二阶段汇总计数、重复出现的短语和有代表性的证据。这类工作大部分可以由代码确定性执行。
Frontier 模型收到的是一个更小、经政策批准的证据包。它的任务是比对主题、识别冲突、解释可能的业务影响,并起草一份高管简报。产品负责人审核证据后,决定哪些内容进入路线图。
这个设计让每个组件都有了一个边界明确的职责:
Frontier 模型看到的是敏感度更低、数据量更少的证据包。本地模型避免了超出其测试范围的决策。人工审核的是一份决策包,而不是数千条原始对话。
混合策略需要一个明确的路由器。否则开发者会逐案选择模型,架构会逐渐偏离。
针对每种任务类型,记录:
路由器可以是网关、工作流服务或应用中的一个小策略层。它的职责是让模型选择变得可重复和可观测。
记录哪条路由处理了任务、模型版本、token 或算力使用量、延迟、评估结果、重试次数和最终处置。这些记录让团队可以在不重新设计整个工作流的情况下替换模型。
用代表生产工作的任务来跑模型 trial。
从一个有边界的任务中选取 50 到 200 个样本。在测试外部服务之前移除或保护敏感数据。在运行模型之前定义通过标准。测量准确率、证据质量、延迟、成本、失败模式和人工审核时间。
至少测试三条路由:
结果可能因步骤不同而异。这是有价值的。一个单一工作流可以对 80% 的 case 使用小型本地模型,将模糊 case 路由到 Frontier API,并把高风险异常发送给人工处理。
从一个工作流开始,画出它的数据路径。用隐私级别、吞吐量、延迟、控制力和错误成本标记每个步骤。分配通过验收测试的最小模型路由,然后把 Frontier 推理留给真正值得它的决策。
在 Nexius Labs,我们将这视为 Loop Engineering 和 Deliberate Model Routing:把每个任务匹配到它真正需要的模型、上下文和验收阈值。