SAFi框架倡导根据任务复杂度动态选择模型:后台任务用廉价模型、脑暴用快速生成模型、初稿用低成本模型、终稿才用前沿模型,从而控制成本与延迟。
AI 行业常常将最强大的模型作为每个问题的默认答案。这种做法很方便,但很少是高效的。
许多 AI 工作流中包含简单重复的、探索性的以及高风险的任务混合。让前沿模型处理所有这些任务,会增加成本、延迟和 token 用量,却不一定能带来更好的结果。
SAFi 采用了不同的方式。通过其模型独立性原则,SAFi 让组织能够为每个任务选择最合适的模型,而不局限于某一家供应商。
一个有用的 AI 工作流不需要在每个步骤都依赖同一个模型。它可以根据复杂性、速度、成本和质量要求,将不同的模型分配到不同的阶段。
这就形成了一种实用的模型路由策略。最强的模型用于真正受益于它的工作,而不会在每个中间步骤都被不必要地使用。
结果是得到一个更加平衡的工作流:更低的运营成本、更快的响应速度,以及对高级模型能力使用去向的更好控制。
SAFi 的设计目标是跨模型和跨供应商工作,而不是将治理绑定到单一供应商。
这种灵活性很重要,因为 AI 模型格局变化很快。新模型可能提供更好的性能、更低的价格、更强的隐私保护,或针对特定任务的更强能力。治理平台不应强迫组织每次在模型策略变更时都重建其控制机制。
借助模型独立性,团队可以根据自己的需求评估模型,并为每个工作负载选择合适的选项。他们也可以在不改变底层治理方式的情况下更换供应商。
即使模型发生变化,策略、决策和监督仍然保持一致。
模型选择只是控制 AI 成本的一部分。对话记忆也对 token 流量、延迟和效率有直接影响。
每次请求时发送完整的对话历史是很诱人的。有时候这是必要的,但通常并非如此。
一个简短的后台任务可能只需要最新的指令。一个头脑风暴环节可能受益于最近的上下文,但不需要从头到尾的每条消息。一个起草任务可能只需要当前大纲和选定的笔记,而不是每次修订的完整历史。
SAFi 让用户可以控制向模型传递多少对话记忆。
默认情况下,SAFi 提供两次完整运行,然后对对话进行摘要。这种方法在保留连续性的同时,限制了发送到后续模型调用的重复上下文量。
对于确实需要完整对话历史的任务,可以将记忆设置为无限。重要的是完整历史是一种选项,而非不可避免的开销。
当大型历史记录被反复包含在模型请求中时,token 用量就会增长。这会影响成本和性能,特别是在有许多顺序调用的工作流中。
SAFi 的记忆控制支持一种更加审慎的方式:
这为团队提供了一种在上下文质量和运营效率之间取得平衡的方法。
目标不是不惜一切代价最小化上下文。目标是为任务提供正确的上下文。
考虑一个正在准备政策文档的组织。
一个成本更低的模型可能首先收集想法、整理笔记并生成初步结构。另一个模型可以识别缺失的部分或将该草稿与内部需求进行对比。然后一个能力更强的模型可以润色语言、解决歧义,并为人工审核准备最终版本。
该组织不需要使用最昂贵的模型来收集笔记或生成粗略备选方案。它可以将该模型保留用于工作流中最需要判断力、精确性和沟通质量的部分。
在整个过程中,SAFi 提供了治理层。策略可以管理 Agent 行为,决策可以被记录以供审查和审计。模型可能在一个步骤到另一个步骤之间发生变化,但组织的控制措施保持不变。
模型选择和记忆管理不仅仅是成本优化功能。它们是负责任 AI 运营的一部分。
对常规工作使用不必要的大型模型会浪费资源。发送不必要的历史记录会增加暴露于无关或敏感信息的风险。选择正确的模型和正确数量的上下文有助于构建一个更受控制和更透明的系统。
随着组织从孤立的实验转向生产级 AI 工作流,这一点尤为重要。在规模上,小的低效率会在数千个任务和模型调用中成倍放大。
因此,一个治理良好的系统应该问两个问题:
SAFi 有助于使这些决策变得可配置,而不是偶然的。
最强大的模型并不自动是每个工作的最佳模型。一个强大的 AI 架构将工作分成多个阶段,并根据每个阶段所需的结果分配资源。
SAFi 通过结合以下内容支持这种架构:
这种方法让组织对成本、性能、隐私和运营一致性有了更多控制。
前沿模型仍然扮演着重要角色。它们对于复杂的推理、敏感的沟通和最终稿件很有价值。但它们应该用在其额外能力能创造真正价值的地方。
并非每个 AI 任务都需要前沿模型。有了 SAFi,组织可以使用正确的模型、正确的上下文量、在正确的治理控制下。
这是一种更实用的 AI 扩展方式。