Cloudflare 将 AI Gateway 和 Workers AI 整合为统一控制面,支持跨托管 GPU 和外部提供商的动态路由与可观测性。
AI Gateway 和 Workers AI 最初是两个独立的产品,但随着时间推移,我们注意到用户群体在趋同。通过 AI Gateway,你可以代理请求到任意模型提供商,同时获得内置的可观测性、日志记录、访问控制和安全保障。在 Workers AI 上,我们在自建的 GPU 基础设施上托管模型,暴露一个 API 端点供你调用推理即服务。
这两个产品的架构看起来不同,但对终端用户而言,它们实现的是同一个目标:用一个精密的控制平面连接各类模型。今天,我们很高兴分享这两个产品如何合并成一条统一路径的计划——让你可以连接到任意模型提供商(包括 Workers AI),同时从一个控制平面管理可观测性、计费、安全和日志。
这是我们一些重大计划的下一步——继续阅读,了解统一控制平面将如何定义模型路由的未来。
一段时间以来,我们一直在通过入口点暗示这两个产品正在走向统一:Workers binding 和 REST API。我们提供了一个 AI binding,可以用来调用 AI Gateway 和 Workers AI。这里不存在所谓"单独的 AI Gateway binding"和"Workers AI binding"这样的概念——一切均通过同一条路径。我们几个月前推出了"默认"网关的理念,这样即使你从未配置过 AI Gateway,也能自动继承 AI Gateway 的可观测性和日志功能。当然,如果你希望将应用程序拆分到多个项目,仍然可以自行指定网关。
以下是通过 AI Gateway 调用 Workers AI 时的 binding 调用方式:
export default {
async fetch(request, env) {
const response = await env.AI.run(
'@cf/zai-org/glm-5.2',
{
messages: [
{ role: 'user', content: 'What is the capital of France?' },
]
},
{
gateway: {
id: 'default', // Use 'default' for the built-in gateway
},
}
);
return new Response(JSON.stringify(response), {
headers: { 'Content-Type': 'application/json' },
});
},
};
我们还宣布了一个统一的 REST API——/ai/ 端点,允许你通过 AI Gateway 对 Workers AI 进行类似的调用。
curl "https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/run/@cf/zai-org/glm-5.2" \
-H "Authorization: Bearer {api_token}" \
-H "Content-Type: application/json" \
-H "cf-aig-gateway-id: default" \
-d '{
"messages": [{"role": "user", "content": "What is the capital of France?"}],
}'
通过这种方式,我们统一了 AI Gateway 和 Workers AI 的入口点,因此你无需在选择先使用哪个产品之间纠结——一切都是开箱即用的。
这次整合最直接的好处之一是,你不再需要显式创建 AI Gateway 才能获得推理流量的可见性。如果你从未设置过网关,只需要在 binding 或 REST API 调用时传入 default 作为网关 ID,AI Gateway 将在首次认证请求时自动为你创建。
通过这种方式,每次请求都会被完整记录(包含请求和响应 payload),每个模型的 token 计数会被追踪,你无需任何仪表盘配置即可获得成本归属。如果你日后不再满足于默认网关——比如你想要自定义缓存规则或按应用程序分割流量——你可以创建一个命名网关,并通过修改单个参数将请求指向它。
以下是 binding 中的用法。之前,你直接调用 Workers AI:
const response = await env.AI.run('@cf/zai-org/glm-5.2', {
messages: [{ role: 'user', content: 'Hello!' }],
});
现在,添加第三个参数即可通过 AI Gateway 路由并获得完整可观测性:
const response = await env.AI.run(
'@cf/zai-org/glm-5.2',
{ messages: [{ role: 'user', content: 'Hello!' }] },
{ gateway: { id: 'default' } } // Auto-creates the gateway on first use
);
前往 Cloudflare AI Gateway 仪表盘,你会看到每一条请求:延迟分解、token 使用量、错误率,以及精确的 prompt 和响应内容。对于正在调试模型行为或审计 AI 输出的团队来说,相比之前两眼一抹黑,这是一个巨大的升级。
我们今天推出的一个新功能是:可以使用 AI Gateway 额度来支付 Workers AI。之前,你只能将 AI Gateway 额度用于外部模型提供商(如 OpenAI、Anthropic),还不能将 AI Gateway 额度应用到 Workers AI 使用上。我们终于打通了系统,实现了 Workers AI 的统一计费。这意味着你可以往钱包里充值额度,然后选择将其花费在 OpenAI、Anthropic、Workers AI 或我们支持的任意提供商上。
由于我们现在为 Workers AI 提供了预付费计费,并且希望鼓励用户使用这一新路径,如果你使用 AI Gateway 统一计费,我们在 Workers AI 模型上还会提供更高的速率限制。关于速率限制的最新信息以及如何申请更高速率限制,请参阅开发者文档。
随着所有推理流量都流经单一控制平面,我们可以开始针对每个请求做出更智能的决策——从你想要的模型出发,而非从你需要管理的提供商出发。提供商优先路由迫使你思考基础设施问题:"我应该调用哪个提供商?他们挂了我怎么办?"模型优先路由则翻转了这一逻辑。你只需思考你需要什么——一个能力强的推理模型、一个快速的摘要模型、一个便宜的嵌入模型——其余的提供商选择、故障转移和负载均衡都由控制平面处理。
今天,如果你想调用一个模型,你必须知道哪个提供商托管了它。如果该提供商宕机或正在限速,你的应用程序就会出问题。我们正在迈向一个你只需指定模型、AI Gateway 来处理其余一切的世界。
这样,你就可以请求 Kimi K2.7 Code,而无需关心它来自 Workers AI、Moonshot 自有 API,还是另一个托管相同权重的提供商。如果 Workers AI 有容量,你就能受益于我们的托管基础设施。如果 Workers AI 满载,网关会透明地将你负载均衡到另一个能提供相同模型的其他提供商。如果你愿意,仍然可以坚持使用单一提供商,但模型优先路由让你在关注弹性时拥有更大的灵活性。我们与经过审核的提供商合作,因此模型输出的质量始终是首要保障,同时也能遵守诸如零数据保留(ZDR)等要求。
curl -X POST "https://api.cloudflare.com/client/v4/accounts/{account_id}/ai/v1/chat/completions" \
-H "Authorization: Bearer {api_token}" \
-H "cf-aig-gateway-id: my-gateway" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k2.7-code",
"messages": [{"role": "user", "content": "Review this function"}]
}'
这也意味着更好的默认弹性。如果某个提供商的模型版本出现问题,流量会自动切换到另一个,无需在应用程序层面重试或在 Workers 中编写复杂的回退逻辑。网关将模型可用性视为一个路由问题。我们希望在未来几个月内为所有 AI Gateway 和 Workers AI 用户推出这一功能的试点。
路由的下一轮演进远不止简单的故障转移。我们正在构建智能路由,它能理解你在问什么,并无需任何配置即可为任务挑选合适的模型。
你无需指定模型,可以让网关自行决定。在底层,一个运行在 Workers AI 上的分类器会读取你的 prompt 并预测它属于哪种任务(编码、研究、摘要、通用问答)、复杂度如何,以及上下文的重要程度。然后一个启发式评分器会将其映射到精选池中最合适的模型。对于希望保持控制的团队,你仍然可以指定精确的模型。对于其他所有人,零配置路径意味着你可以在不维护自己路由逻辑的情况下获得更好的经济效益和性能。我们目前正在内部试点,并将在发布前积极测试和迭代几周。
如果你已经在使用 Workers AI,尝试这一功能最简单的方式是将现有调用通过默认网关路由。你会立即获得请求日志、token 追踪和成本归属,而无需改变调用模型的任何其他方式。
如果你已经在使用 AI Gateway,将 Workers AI 加入混合使用就像调用一个 Workers AI 模型一样简单。充值你的 AI Gateway 钱包,你将获得我们支持的所有提供商的统一计费,并且在 Workers AI 模型上享受更高的速率限制。
立即设置你的第一个网关,浏览 Workers AI 模型目录,开始构建吧。