前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9467
  • 日本开发者给 Claude Code 的 Awwwards 级前端 prompt
  • Reflection发布Beam:非中国最强开源模型,编程推理对标GLM
  • Codex CLI vs Claude Code:相同任务实测成本公开
  • Google Docs原生支持Markdown,AI Agent协作成亮点
  • Meta、微软要求员工少用Claude节省成本
  • DeepSeek Harness:24 万 stars 的插件化 AI 工具链
  • 如何给AI编程助手提供正确上下文
  • 12GB显卡跑125B大模型:Strata引擎开源
  • AI 指令遵循失效的深层原因:语义理解≠可靠执行
  • ML 系统上线前的设计审计五问
  • 本地 AI Agent 组织化管理:带预算与汇报链的开源框架
  • LangGraph 替代指南:六大框架实际解决的不同痛点
  • llama-server 推测解码时 logprobs 为假值
  • Reflection AI 开源 Beam:23B 活跃参数的 MoE 编程模型
  • Agent CLI 真实故障:会话消失、幽灵项目、重复条目
  • 发版日 CI 暴露绿灯测试掩盖的五大问题
  • 退款重复处理:分布式事件幂等性实战分析
  • Vercel如何用AI自动化Inbound流程
  • Anthropic推出云端Cowork:AI推理全上云,本地只做文件访问
  • 自建 SearXNG 为 LLM Agent 省钱:缓存 + 限流 + 引文校验
  • GLM 5.3 登陆 Amazon Bedrock:753B 编程专家模型
  • 前端后端错误追踪关联实战:用 trace_id 串联浏览器异常与 API 失败
  • LoreConvo:为 AI 编程工具注入会话记忆,告别每次从零开始
  • DevFest 演讲实录:如何客观评估 AI 辅助开发体验
  • Together Link:一条命令让Claude Code用上Kimi K3、GLM 5.3等开源模型
  • PewDiePie用OpenAI数据微调本地模型反被封号
  • MCP协议存在Agent间恶意Prompt传播风险
  • 某MCP服务器启动前消耗18000 tokens:问题与解决方案
  • Reflection AI开源501B MoE模型Beam,专攻代码生成
  • Google展示生产级AI数据层实战:语义搜索+RAG+AlloyDB集成
  • Reflection AI发布Beam:主打企业AI工厂概念
  • Meta和微软削减Claude预算,转向自研AI工具
  • 笔记本即可运行的 AI 安全检测,效果逼近 350 亿参数模型
  • Reka 发布 Rho-1:统一处理文本/图像/视频/机器人控制的 19B 多模态模型
  • OpenAI在欧盟对ChatGPT和Codex启用文本水印
  • OpenAI文本水印欧盟强制落地,全球API用户可自主选择
  • Claude Code 登陆 AWS GovCloud,支持受监管工作负载
  • AWS SageMaker 为编程 Agent 上线 AI 推理优化技能
  • 团队引入 Agentic Coding 的实战方法论
  • 团队引入 Agentic Coding 的实战方法论
  • quota-audit:用 Claude Code 必看的额度消耗分析插件
  • quota-audit:Claude Code 额度消耗追踪插件
  • Cloudflare 发布 Clef 决策模型,实测对比 Jev
  • Claude Mythos 5.1 发布,整合 Lean 4 形式化证明编译器
  • GitHub 发布代码审查 AI Agent 评测基准 ReviewBench
  • Amazon Bedrock跨账户资源自动化迁移实战
  • LangChain+Bedrock知识库:代理式检索实战对比
  • Bedrock AgentCore多代理系统可解释性与有用性评估指南
  • 企业AI Agent为何总缺知识而非数据
  • AI Agent测试用例:合成数据vs生产数据对比
  • x402协议教程:AI代理免API key按次付费
  • 已加载 51 / 9467
9.0
重磅
AI SCORE
模型发布2026-10-06 07:25

GLM 5.3 登陆 Amazon Bedrock:753B 编程专家模型

AWS ML Blog#GLM#AWS Bedrock#代码模型
Editor brief · 编辑速览

智谱 753B 参数 MoE 模型专攻代码和长程 Agent 任务,现已在 AWS Bedrock 可用,支持 OpenAI 兼容 API 和提示缓存。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Coding 和 agentic 工作负载对 AI 模型的要求比以往任何时候都更高:对跨越数百个文件的代码仓库进行重构,在不丢失上下文的情况下维持数小时的多步骤 agentic 工作流,并在每一步都使用工具来推理复杂系统问题。一直以来,使用开源权重模型满足这些需求意味着要自行配置和运维推理基础设施。

GLM 5.3 来自 Z.ai(智谱 AI),现已上线 Amazon Bedrock。GLM 5.3 如同在 Hugging Face Hub 上发布的那样,是一个 753B 参数的混合专家模型,针对 coding 和长周期 agentic 任务进行了优化。特别是,Z.ai 报告该模型展现出显著的网络安全能力。在 Amazon Bedrock 上,你现在可以通过全托管 API 使用它,支持跨区域推理、Prompt 缓存和服务层级。无需管理任何基础设施。GLM 5.3 on Bedrock 对符合条件的企业客户开放。

本文将展示如何在 Amazon Bedrock 上使用 OpenAI 兼容 API 调用 GLM 5.3,并通过 Prompt 缓存降低成本和延迟。然后,我们将在一个真实的 agentic 工作流中运行该模型:使用 Strix(一个开源 AI 渗透测试 agent)对自有应用进行授权安全测试。

与 GLM 5 相比的新特性

GLM 5 于今年早些时候上线 Amazon Bedrock。GLM 5.3 在同一谱系上构建,带来了一系列重要提升:

更强的 coding 能力: Z.ai 声称在包括 DeepSWE、Terminal Bench 3.0 和 FrontierSWE 在内的一系列 coding 基准测试中具有竞争力的表现。他们还报告称在其内部 coding 基准测试中比 GLM 5.2 提升了 50%。由于提升幅度巨大,基准测试本身自 GLM 5.1 发布以来已经更新,因此未报告与 GLM 5 的直接对比。

涌现的网络安全能力: 安全任务上的基准测试表现尤为突出,这使得该模型非常适合防御性安全工作流。例如,Z.ai 在发布时在 CyberGym 基准测试中测量到了 84.5 的领先分数。

更广泛的 Amazon Bedrock 集成: 跨区域推理配置文件、隐式和显式 Prompt 缓存,以及 OpenAI 兼容 Responses 和 Chat Completions API 与 Invoke 和 Converse 的功能 parity 提升。

核心能力

前沿的 coding 和 agentic 性能。 GLM 5.3 专为复杂系统工程和长周期 agentic 任务设计。这些任务包括多步骤推理、工具增强工作流以及跨大型代码仓库的持续上下文保持。

灵活的 API 访问。 你可以通过 OpenAI 兼容的 Responses 和 Chat Completions API 调用 GLM 5.3,也可以通过 Amazon Bedrock 的 Invoke 和 Converse API。

Prompt 缓存。 GLM 5.3 默认支持隐式(自动)Prompt 缓存。Responses 和 Chat Completions API 上还支持显式缓存控制(推荐)。对于每次请求都会重发大型系统 Prompt 或代码仓库上下文的 agentic 工作负载,缓存可以降低延迟和输入成本。

跨区域推理。 GLM 5.3 可通过美国跨区域推理(us.zai.glm-5.3)和全球跨区域推理(global.zai.glm-5.3)配置文件使用。你将请求发送到所选的"源"AWS 区域,Amazon Bedrock 会安全地将每个请求路由到相应位置进行处理。更多详情请参阅 Amazon Bedrock 用户指南。

服务层级。 选择 Flex 以优化非时间敏感工作负载的成本,选择 Priority 以优先处理对延迟敏感的关键请求(以更高价格为代价),或选择 Standard 以获得价格和速度之间的默认平衡。

前置条件

对于以下使用示例,你需要:

  • 一个可访问 Amazon Bedrock 的 AWS 账户。
  • AWS Identity and Access Management (IAM) 权限,用于调用基础模型和目标推理配置文件:bedrock:InvokeModel、bedrock:InvokeModelWithResponseStream 和 bedrock:CallWithBearerToken。
  • (对于基于代码的演示)Python 3.10 或更高版本。
  • (仅适用于可选的安全测试演示)安装 Docker 和带 bedrock 扩展的 Strix。

在 Amazon Bedrock 控制台上试用 GLM 5.3

你可以通过 AWS Management Console 开始向 GLM 5.3 发送 Prompt,无需编写代码或安装开发工具。要开始使用,请导航到 Amazon Bedrock,然后从左侧边栏菜单中选择 Test > Playground。

Figure 1: Chatting with GLM 5.3 on the Amazon Bedrock console

在这个 playground 界面中,你可以从模型列表中选择 GLM 5.3,并通过聊天 UI 发送你的第一个 Prompt,如上面的截图所示。

开始使用 Responses API

通过编程方式,你可以通过 bedrock-runtime 端点调用模型。它同时支持 OpenAI 兼容的 Responses 和 Chat Completions API,以及 Amazon Bedrock 的 Invoke 和 Converse API 用于 GLM 5.3。对于新应用,推荐使用 OpenAI 兼容 API,因为它们支持更完整的功能集。

Amazon Bedrock 确实支持为需要它们的 OpenAI 兼容集成生成 API 密钥。但是,我们强烈建议尽可能优先使用短期凭证而非长期 API 密钥。

在以下示例中,我们将使用 OpenAI Python SDK 从 Python 调用 Responses API,并使用 aws-bedrock-token-generator 库从你的标准 AWS CLI 凭证生成短期令牌。

安装所需的包:

pip install -U openai aws-bedrock-token-generator

将以下代码保存为 bedrock-request.py:

from aws_bedrock_token_generator import provide_token
from openai import OpenAI

region = "us-west-2"  # Your source AWS Region

client = OpenAI(
    api_key=provide_token(region=region),
    base_url=f"https://bedrock-runtime.{region}.amazonaws.com/openai/v1",
)

resp = client.responses.create(
    input="Refactor this Python function to be iterative instead of recursive: ...",
    model="global.zai.glm-5.3",
)

print(resp.output_text)

运行脚本,它将显示模型的输出:

python bedrock-request.py

使用显式 Prompt 缓存优化推理

长时间运行的 coding 和知识工作流通常会在多个对话轮次中重发稳定上下文,例如系统 Prompt、工具定义或代码仓库文件。

Amazon Bedrock 上的 GLM 5.3 默认支持隐式 Prompt 缓存,这有助于减少共享相同初始 Prompt 前缀的重复调用的响应延迟和输入令牌成本。

使用显式 Prompt 缓存模式,你可以明确标识可重用的 Prompt 前缀,这可以进一步提高缓存命中率(从而降低延迟和成本节省),优于隐式缓存。

要使用 GLM 5.3 的显式 Prompt 缓存,如下例所示:

  • 通过请求上的 prompt_cache_options 选择显式缓存模式。
  • 在输入内容块上添加一个或多个 prompt_cache_breakpoint 标记,以指示可重用 Prompt 前缀的结束(含)。
resp = client.responses.create(
    model="global.zai.glm-5.3",
    # Enable explicit caching mode:
    extra_body={"prompt_cache_options": {"mode": "explicit"}},
    input=[
        {
            "type": "message",
            "role": "system",
            "content": [
                {
                    "type": "input_text",
                    "text": SYSTEM_PROMPT,
                    # A long, static system prompt is a great target for caching:
                    "prompt_cache_breakpoint": {"mode": "explicit"},
                },
            ]
        },
        {
            "type": "message",
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": USER_INPUT,
                    # Multiple breakpoints can also be defined, for layered cache:
                    "prompt_cache_breakpoint": {"mode": "explicit"},
                },
            ],
        },
    ],
)

if resp.usage.input_tokens_details.cached_tokens:
    print("Hit cache!")

更多信息,请参阅 Amazon Bedrock 用户指南的 Prompt 缓存部分。

示例 agentic 工作负载:使用 Strix 进行授权安全测试

直接从 GLM 5.3 的优势中受益的一种工作负载是对自有应用进行自动化安全测试。Strix 是一个开源 AI 渗透测试 agent,它动态运行你的代码,发现漏洞,并用概念验证测试验证它们。在撰写本文时,Strix 文档使用 GLM 5.3 作为其默认模型。你可以将 Strix 配置为使用 Amazon Bedrock 上的 GLM 5.3,而不是第三方推理提供商,这样模型推理就在你的 AWS 账户控制下运行。

仅测试你拥有或已获得明确书面许可测试的应用。 对你不拥有的系统进行未经授权的安全测试在大多数司法管辖区是违法的,并违反 AWS 合理使用政策。在本演练中,目标是 OWASP Juice Shop,这是一个在你本地机器上运行的故意存在漏洞的示例应用。

如果你希望在自行运行开源 agent 之外获得全托管、持续的安全测试,AWS Continuum 提供按需渗透测试和其他安全分析作为托管服务。这两种方法是互补的:像 Strix 这样的开源 agent 为你提供开发者驱动、人工介入且高度可定制的测试,适用于本地构建;而 AWS Continuum 则大规模运行托管评估。

运行授权安全测试的步骤

  1. 在本地启动示例 Juice Shop 目标应用:
docker run --rm -p 3000:3000 bkimminich/juice-shop
  1. 将 Strix 配置为使用 Amazon Bedrock 上的 GLM 5.3。Strix 在底层使用 LiteLLM,因此(如其 Amazon Bedrock 文档中所述)你的 AWS CLI 凭证将被自动获取。这意味着不需要 API 密钥,但你可能需要设置环境变量(如 AWS_PROFILE 和 AWS_REGION)来配置连接。在撰写本文时,LiteLLM 尚未解析 bedrock/global.zai.glm-5.3。在此问题修复之前,你可以显式指定 Converse API 路由和推理配置文件 Amazon Resource Name (ARN),如下面的代码片段所示:
# Fill in the REGION and ACCOUNT_ID placeholders below before running!
export STRIX_LLM="bedrock/converse/arn:aws:bedrock:{AWS_REGION}:{AWS_ACCOUNT_ID}:inference-profile/global.zai.glm-5.3"
  1. 针对本地目标运行 Strix:
strix --target http://localhost:3000
  1. 等待根 Strix agent 完成,然后审查发现。

Strix 会启动一组子 agent 来映射威胁面、探索潜在漏洞类别范围,并尝试用可工作的概念验证来验证每个发现。这有助于减少分类误报所花费的时间。成功的运行将生成一份报告,包括每个发现的严重程度、证据和修复指导。

Figure 2: Running an example security test with GLM 5.3 and Strix

上面的视频展示了针对示例应用设置和运行 Strix的端到端过程,以及探索结果的过程。

完成后,通过在运行它的终端中按 Ctrl+C 来停止 Juice Shop 容器,或者运行 docker ps 找到容器 ID 并用 docker stop <container-id> 停止它。Amazon Bedrock 推理按 Token 付费,没有持久资源,因此在请求完成后不会产生进一步的费用。如果你在本演练中生成了 Amazon Bedrock API 密钥且不再需要它,请在 Amazon Bedrock 控制台上将其删除。

后续步骤

在 Amazon Bedrock 控制台上试用 GLM 5.3,通过编码助手(如我们最近关于 Kimi K3 的文章中所示的 OpenCode)使用它,或通过支持的 API 连接你的自定义应用。

有兴趣了解 Amazon Bedrock 如何支持你的团队吗?与我们联系开始对话。

Original source

本文由 AI 翻译整理自 AWS ML Blog,原文版权归原作者所有。

阅读英文原文
上一篇
自建 SearXNG 为 LLM Agent 省钱:缓存 + 限流 + 引文校验
下一篇
前端后端错误追踪关联实战:用 trace_id 串联浏览器异常与 API 失败