智谱 753B 参数 MoE 模型专攻代码和长程 Agent 任务,现已在 AWS Bedrock 可用,支持 OpenAI 兼容 API 和提示缓存。
Coding 和 agentic 工作负载对 AI 模型的要求比以往任何时候都更高:对跨越数百个文件的代码仓库进行重构,在不丢失上下文的情况下维持数小时的多步骤 agentic 工作流,并在每一步都使用工具来推理复杂系统问题。一直以来,使用开源权重模型满足这些需求意味着要自行配置和运维推理基础设施。
GLM 5.3 来自 Z.ai(智谱 AI),现已上线 Amazon Bedrock。GLM 5.3 如同在 Hugging Face Hub 上发布的那样,是一个 753B 参数的混合专家模型,针对 coding 和长周期 agentic 任务进行了优化。特别是,Z.ai 报告该模型展现出显著的网络安全能力。在 Amazon Bedrock 上,你现在可以通过全托管 API 使用它,支持跨区域推理、Prompt 缓存和服务层级。无需管理任何基础设施。GLM 5.3 on Bedrock 对符合条件的企业客户开放。
本文将展示如何在 Amazon Bedrock 上使用 OpenAI 兼容 API 调用 GLM 5.3,并通过 Prompt 缓存降低成本和延迟。然后,我们将在一个真实的 agentic 工作流中运行该模型:使用 Strix(一个开源 AI 渗透测试 agent)对自有应用进行授权安全测试。
GLM 5 于今年早些时候上线 Amazon Bedrock。GLM 5.3 在同一谱系上构建,带来了一系列重要提升:
更强的 coding 能力: Z.ai 声称在包括 DeepSWE、Terminal Bench 3.0 和 FrontierSWE 在内的一系列 coding 基准测试中具有竞争力的表现。他们还报告称在其内部 coding 基准测试中比 GLM 5.2 提升了 50%。由于提升幅度巨大,基准测试本身自 GLM 5.1 发布以来已经更新,因此未报告与 GLM 5 的直接对比。
涌现的网络安全能力: 安全任务上的基准测试表现尤为突出,这使得该模型非常适合防御性安全工作流。例如,Z.ai 在发布时在 CyberGym 基准测试中测量到了 84.5 的领先分数。
更广泛的 Amazon Bedrock 集成: 跨区域推理配置文件、隐式和显式 Prompt 缓存,以及 OpenAI 兼容 Responses 和 Chat Completions API 与 Invoke 和 Converse 的功能 parity 提升。
前沿的 coding 和 agentic 性能。 GLM 5.3 专为复杂系统工程和长周期 agentic 任务设计。这些任务包括多步骤推理、工具增强工作流以及跨大型代码仓库的持续上下文保持。
灵活的 API 访问。 你可以通过 OpenAI 兼容的 Responses 和 Chat Completions API 调用 GLM 5.3,也可以通过 Amazon Bedrock 的 Invoke 和 Converse API。
Prompt 缓存。 GLM 5.3 默认支持隐式(自动)Prompt 缓存。Responses 和 Chat Completions API 上还支持显式缓存控制(推荐)。对于每次请求都会重发大型系统 Prompt 或代码仓库上下文的 agentic 工作负载,缓存可以降低延迟和输入成本。
跨区域推理。 GLM 5.3 可通过美国跨区域推理(us.zai.glm-5.3)和全球跨区域推理(global.zai.glm-5.3)配置文件使用。你将请求发送到所选的"源"AWS 区域,Amazon Bedrock 会安全地将每个请求路由到相应位置进行处理。更多详情请参阅 Amazon Bedrock 用户指南。
服务层级。 选择 Flex 以优化非时间敏感工作负载的成本,选择 Priority 以优先处理对延迟敏感的关键请求(以更高价格为代价),或选择 Standard 以获得价格和速度之间的默认平衡。
对于以下使用示例,你需要:
你可以通过 AWS Management Console 开始向 GLM 5.3 发送 Prompt,无需编写代码或安装开发工具。要开始使用,请导航到 Amazon Bedrock,然后从左侧边栏菜单中选择 Test > Playground。

在这个 playground 界面中,你可以从模型列表中选择 GLM 5.3,并通过聊天 UI 发送你的第一个 Prompt,如上面的截图所示。
通过编程方式,你可以通过 bedrock-runtime 端点调用模型。它同时支持 OpenAI 兼容的 Responses 和 Chat Completions API,以及 Amazon Bedrock 的 Invoke 和 Converse API 用于 GLM 5.3。对于新应用,推荐使用 OpenAI 兼容 API,因为它们支持更完整的功能集。
Amazon Bedrock 确实支持为需要它们的 OpenAI 兼容集成生成 API 密钥。但是,我们强烈建议尽可能优先使用短期凭证而非长期 API 密钥。
在以下示例中,我们将使用 OpenAI Python SDK 从 Python 调用 Responses API,并使用 aws-bedrock-token-generator 库从你的标准 AWS CLI 凭证生成短期令牌。
安装所需的包:
pip install -U openai aws-bedrock-token-generator
将以下代码保存为 bedrock-request.py:
from aws_bedrock_token_generator import provide_token
from openai import OpenAI
region = "us-west-2" # Your source AWS Region
client = OpenAI(
api_key=provide_token(region=region),
base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
)
resp = client.responses.create(
input="Refactor this Python function to be iterative instead of recursive: ...",
model="global.zai.glm-5.3",
)
print(resp.output_text)
运行脚本,它将显示模型的输出:
python bedrock-request.py
长时间运行的 coding 和知识工作流通常会在多个对话轮次中重发稳定上下文,例如系统 Prompt、工具定义或代码仓库文件。
Amazon Bedrock 上的 GLM 5.3 默认支持隐式 Prompt 缓存,这有助于减少共享相同初始 Prompt 前缀的重复调用的响应延迟和输入令牌成本。
使用显式 Prompt 缓存模式,你可以明确标识可重用的 Prompt 前缀,这可以进一步提高缓存命中率(从而降低延迟和成本节省),优于隐式缓存。
要使用 GLM 5.3 的显式 Prompt 缓存,如下例所示:
resp = client.responses.create(
model="global.zai.glm-5.3",
# Enable explicit caching mode:
extra_body={"prompt_cache_options": {"mode": "explicit"}},
input=[
{
"type": "message",
"role": "system",
"content": [
{
"type": "input_text",
"text": SYSTEM_PROMPT,
# A long, static system prompt is a great target for caching:
"prompt_cache_breakpoint": {"mode": "explicit"},
},
]
},
{
"type": "message",
"role": "user",
"content": [
{
"type": "input_text",
"text": USER_INPUT,
# Multiple breakpoints can also be defined, for layered cache:
"prompt_cache_breakpoint": {"mode": "explicit"},
},
],
},
],
)
if resp.usage.input_tokens_details.cached_tokens:
print("Hit cache!")
更多信息,请参阅 Amazon Bedrock 用户指南的 Prompt 缓存部分。
直接从 GLM 5.3 的优势中受益的一种工作负载是对自有应用进行自动化安全测试。Strix 是一个开源 AI 渗透测试 agent,它动态运行你的代码,发现漏洞,并用概念验证测试验证它们。在撰写本文时,Strix 文档使用 GLM 5.3 作为其默认模型。你可以将 Strix 配置为使用 Amazon Bedrock 上的 GLM 5.3,而不是第三方推理提供商,这样模型推理就在你的 AWS 账户控制下运行。
仅测试你拥有或已获得明确书面许可测试的应用。 对你不拥有的系统进行未经授权的安全测试在大多数司法管辖区是违法的,并违反 AWS 合理使用政策。在本演练中,目标是 OWASP Juice Shop,这是一个在你本地机器上运行的故意存在漏洞的示例应用。
如果你希望在自行运行开源 agent 之外获得全托管、持续的安全测试,AWS Continuum 提供按需渗透测试和其他安全分析作为托管服务。这两种方法是互补的:像 Strix 这样的开源 agent 为你提供开发者驱动、人工介入且高度可定制的测试,适用于本地构建;而 AWS Continuum 则大规模运行托管评估。
docker run --rm -p 3000:3000 bkimminich/juice-shop
# Fill in the REGION and ACCOUNT_ID placeholders below before running!
export STRIX_LLM="bedrock/converse/arn:aws:bedrock:{AWS_REGION}:{AWS_ACCOUNT_ID}:inference-profile/global.zai.glm-5.3"
strix --target http://localhost:3000
Strix 会启动一组子 agent 来映射威胁面、探索潜在漏洞类别范围,并尝试用可工作的概念验证来验证每个发现。这有助于减少分类误报所花费的时间。成功的运行将生成一份报告,包括每个发现的严重程度、证据和修复指导。

上面的视频展示了针对示例应用设置和运行 Strix的端到端过程,以及探索结果的过程。
完成后,通过在运行它的终端中按 Ctrl+C 来停止 Juice Shop 容器,或者运行 docker ps 找到容器 ID 并用 docker stop <container-id> 停止它。Amazon Bedrock 推理按 Token 付费,没有持久资源,因此在请求完成后不会产生进一步的费用。如果你在本演练中生成了 Amazon Bedrock API 密钥且不再需要它,请在 Amazon Bedrock 控制台上将其删除。
在 Amazon Bedrock 控制台上试用 GLM 5.3,通过编码助手(如我们最近关于 Kimi K3 的文章中所示的 OpenCode)使用它,或通过支持的 API 连接你的自定义应用。
有兴趣了解 Amazon Bedrock 如何支持你的团队吗?与我们联系开始对话。