Cloudflare 推出专为 Agent 设计的 AI 推理基础设施,提供企业级部署和成本优化方案。
AI 模型正在快速变化:今天最适合 Agent 编程的模型,三个月后可能就会变成另一家提供商推出的完全不同的模型。不仅如此,真实世界的用例往往还需要调用多个模型。你的客户支持 Agent 可能会使用快速、低成本的模型对用户消息进行分类;使用大型推理模型规划行动;再使用轻量级模型执行各项具体任务。
这意味着你需要访问所有模型,同时避免在财务和运营层面被单一提供商绑定。你还需要建立合适的系统,监控不同提供商的成本,在某家提供商发生故障时确保可靠性,并且无论用户身处何地,都能有效管理延迟。
只要使用 AI 构建应用,就会遇到这些挑战;而在构建 Agent 时,问题会更加突出。一个简单的聊天机器人可能针对每条用户 prompt 只发起一次推理调用。一个 Agent 为了完成单项任务,可能会串联十次调用。这时,单个响应缓慢的提供商带来的就不再是 50ms 的延迟,而是 500ms。一次失败的请求也不再只是简单重试,而可能突然引发一连串的下游故障。
自 AI Gateway 和 Workers AI 发布以来,我们看到开发者广泛采用 Cloudflare 构建 AI 应用;为了跟上大家的需求,我们也一直在快速迭代!仅在过去几个月里,我们就更新了控制面板,增加了无需配置的默认 gateway、上游故障自动重试功能,以及更细粒度的日志控制。今天,我们要把 Cloudflare 打造成一个统一的推理层:通过一个 API 访问来自任意提供商的任意 AI 模型,同时兼顾速度与可靠性。
从今天开始,你可以使用已经用于 Workers AI 的同一个 AI.run() binding 调用第三方模型。如果你正在使用 Workers,那么从 Cloudflare 托管的模型切换到 OpenAI、Anthropic 或其他任意提供商的模型,只需修改一行代码。
const response = await env.AI.run('anthropic/claude-opus-4-6',{
input: 'What is Cloudflare?',
}, {
gateway: { id: "default" },
});
对于不使用 Workers 的用户,我们将在未来几周内推出 REST API 支持,让你能够从任意环境访问完整的模型目录。
我们也很高兴地宣布,现在你将能够访问来自 12 家以上提供商的 70 多个模型——全部通过同一个 API 调用,只需修改一行代码即可切换模型,并且可以使用同一套 credits 付费。随着工作的推进,我们还会迅速扩充这个目录。
你可以浏览我们的模型目录,为自己的用例寻找最合适的模型。其中既包括托管在 Cloudflare Workers AI 上的开源模型,也包括各大模型提供商的专有模型。我们很高兴能够进一步开放 Alibaba Cloud、AssemblyAI、Bytedance、Google、InWorld、MiniMax、OpenAI、Pixverse、Recraft、Runway 和 Vidu 的模型,这些公司将通过 AI Gateway 提供其模型。值得注意的是,我们正在把图像、视频和语音模型纳入模型产品,让你可以构建多模态应用。
通过一个 API 访问所有模型,也意味着你可以在一个地方管理全部 AI 支出。如今,大多数公司平均会调用来自多家提供商的 3.5 个模型,这意味着任何单一提供商都无法让你全面了解自己的 AI 使用情况。借助 AI Gateway,你将获得一个集中监控和管理 AI 支出的平台。
通过在请求中加入自定义 metadata,你可以按照自己最关心的属性拆分成本,例如免费用户与付费用户各自的支出、每位客户产生的支出,或者应用中特定工作流产生的支出。
const response = await env.AI.run('@cf/moonshotai/kimi-k2.5',
{
prompt: 'What is AI Gateway?'
},
{
metadata: { "teamId": "AI", "userId": 12345 }
}
);
AI Gateway 让你可以通过一个 API 访问所有提供商的模型。但有时,你需要运行一个使用自有数据进行 fine-tuning 的模型,或者一个针对特定用例优化过的模型。为此,我们正在开发让用户将自己的模型接入 Workers AI 的能力。
我们绝大多数流量来自 Enterprise 客户的专用实例,这些客户正在我们的平台上运行自定义模型,而我们希望让更多客户也能使用这项能力。为此,我们利用 Replicate 的 Cog 技术,帮助你将机器学习模型容器化。
Cog 的设计非常简单:你只需要在 cog.yaml 文件中写明依赖项,并在一个 Python 文件中编写推理代码。Cog 会把 ML 模型打包过程中所有棘手的问题抽象掉,例如 CUDA 依赖、Python 版本、权重加载等。
cog.yaml 文件示例:
build:
python_version: "3.13"
python_requirements: requirements.txt
predict: "predict.py:Predictor"
predict.py 文件示例,其中包含一个设置模型的函数,以及一个在收到推理请求(即 prediction)时运行的函数:
from cog import BasePredictor, Path, Input
import torch
class Predictor(BasePredictor):
def setup(self):
"""Load the model into memory to make running multiple predictions efficient"""
self.net = torch.load("weights.pth")
def predict(self,
image: Path = Input(description="Image to enlarge"),
scale: float = Input(description="Factor to scale image by", default=1.5)
) -> Path:
"""Run a single prediction on the model"""
# ... pre-processing ...
output = self.net(input)
# ... post-processing ...
return output
接下来,你可以运行 cog build 构建容器镜像,再将 Cog 容器推送到 Workers AI。我们会替你部署并提供该模型的服务,之后你就可以通过常用的 Workers AI API 访问它。
为了让更多客户能够使用这项能力,我们正在推进一些大型项目,例如提供面向客户的 API 和 wrangler 命令,让你能够推送自己的容器;我们还会通过 GPU snapshotting 实现更快的冷启动。我们一直在与 Cloudflare 内部团队以及一些外部客户共同测试这些能力,他们也在帮助我们塑造产品愿景。如果你有兴趣成为我们的设计合作伙伴,请联系我们!很快,任何人都可以打包自己的模型,并通过 Workers AI 使用它。
如果你正在构建实时 Agent,通过 AI Gateway 使用 Workers AI 模型会格外强大。在这类场景中,用户对速度的感受取决于首个 token 的生成时间,或者说 Agent 多快开始响应,而不是生成完整响应需要多长时间。即使总推理时间都是 3 秒,首个 token 提前 50ms 到达,也足以决定一个 Agent 给人的感觉是轻快敏捷,还是迟缓拖沓。
Cloudflare 的数据中心网络覆盖全球 330 座城市,这意味着 AI Gateway 可以同时靠近用户和推理端点,最大限度地缩短开始流式传输之前的网络耗时。
Workers AI 的公共目录还托管了开源模型,现在其中已经包含专为 Agent 打造的大型模型,包括 Kimi K2.5 和实时语音模型。当你通过 AI Gateway 调用这些由 Cloudflare 托管的模型时,无需通过公共互联网进行额外的网络跳转,因为你的代码和推理都运行在同一个全球网络上,从而让 Agent 获得尽可能低的延迟。
在构建 Agent 时,速度并不是用户唯一关心的因素,可靠性同样重要。Agent 工作流中的每一步都依赖之前的步骤。可靠的推理对 Agent 至关重要,因为一次调用失败就可能影响后续的整条调用链。
通过 AI Gateway,如果你调用的模型由多家提供商提供,而其中一家发生故障,我们会自动把请求路由到另一家可用的提供商,无需你自己编写任何故障转移逻辑。
如果你使用 Agents SDK 构建长时间运行的 Agent,流式推理调用同样能够抵御连接中断。AI Gateway 会在生成流式响应时对其进行缓冲,这个过程不受 Agent 生命周期影响。如果 Agent 在推理过程中被中断,它可以重新连接 AI Gateway 并取回响应,无需重新发起推理调用,也不必为相同的输出 token 支付两次费用。再结合 Agents SDK 内置的 checkpointing,最终用户完全不会察觉到中断。
Replicate 团队已经正式加入我们的 AI Platform 团队,以至于我们现在根本不再把彼此视为两个独立团队。我们一直在努力推进 Replicate 与 Cloudflare 之间的集成,包括将 Replicate 的所有模型接入 AI Gateway,以及把托管模型迁移到 Cloudflare 基础设施上。很快,你将能够通过 AI Gateway 访问自己在 Replicate 上喜爱的模型,也能把原先部署在 Replicate 上的模型托管到 Workers AI。
如果想开始使用,请查看 AI Gateway 或 Workers AI 的文档。你也可以通过 Agents SDK 进一步了解如何在 Cloudflare 上构建 Agent。
在 Cloudflare TV 上观看