AWS Agent Toolkit 新增 aws-ai-ml skill,让 Kiro、Claude Code、Codex 等编程 Agent 能生成 SageMaker SDK 代码进行推理基准测试。
越来越多的工程师使用编程辅助工具来加速开发流程。如今,Amazon SageMaker AI 优化的生成式 AI 推理推出了 aws-ai-ml skill,通过 AWS Agent Toolkit 提供。该技能让 Kiro、Claude Code、Codex 等编程智能体深入掌握推理优化和性能基准测试。安装该技能后,你现有的智能体就能代你执行端点基准测试、推荐部署配置、比较性能运行结果,并生成可执行的 SageMaker Python SDK v3 代码。aws-ai-ml skill 是一个工具包,可接入任何支持 Model Context Protocol(MCP)的编程智能体,将其变身为 SageMaker AI 推理优化专家。
本文将介绍该技能的功能、如何设置,以及它如何帮助你更快地从模型落地到生产环境。
Amazon SageMaker AI 支持跨实时、批处理和异步模式的 serverful 托管。它提供按需和预留容量、异构实例、虚拟私有云(VPC)隔离、自动扩缩容,以及与所有 SageMaker AI 训练路径的集成。覆盖面既广又深,但大多数工程师并不是带着这方面的知识来的——他们不知道哪个实例族或Serving容器最能满足需求。他们带着使用场景而来:想要达成的性能目标、需要控制的成本范围,或者需要在投入生产前评估的模型。
SageMaker AI 优化生成式 AI 推理的智能体体验弥补了这一差距。你告诉智能体你想完成什么,它就会生成可执行的 SageMaker Python SDK v3 代码,你可以审查、修改并在自己的环境中运行。智能体会提出有针对性的澄清问题,基于真实基准测试和实测性能数据生成代码,并像解决方案架构师一样适应你的业务约束。
在整个过程中,你始终掌控全局。每个步骤都实时可见,并表达为你可以阅读和质疑的代码。没有任何操作发生在不透明的 UI 背后。
你可以在本地机器上通过 AWS Agent Toolkit 安装 aws-ai-ml skill,也可以在 Amazon SageMaker Studio 的 JupyterLab 空间中使用的。无论哪种方式,你都可以在 10 分钟内从零开始进行一次有效的对话。
步骤 1:安装 AWS Agent Toolkit。 如果你还没有安装,请先设置 Agent Toolkit。这需要 AWS Command Line Interface(AWS CLI)2.35+ 和 uv。
aws configure agent-toolkit
该命令会自动检测你的智能体、安装技能,并配置 AWS MCP Server。关于智能体特定设置(插件安装命令、MCP 配置),请参阅 AWS Agent Toolkit 入门指南。
步骤 2:安装 aws-ai-ml skill。 将 SageMaker AI 优化的生成式 AI 推理技能添加到你的智能体:
npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml
步骤 3:确认并开始。 打开你的编程智能体的聊天面板,问:“有哪些可用的技能?”你应该能看到 aws-ai-ml 列出。确认后,用自然语言描述你的意图。你的编程智能体现在已内置了 SageMaker AI 推理优化专业知识。
前提条件:你的 AWS 凭证必须具有调用 SageMaker AI API 的权限(创建端点、运行基准测试和推荐任务)。该技能生成的代码在你的凭证下运行。技能本身不需要额外的 AWS Identity and Access Management(IAM)配置。
注意:对于 Kiro 和 Claude Code,智能体可以在运行时发现技能。它们可以通过 AWS MCP Server 按需搜索和加载技能,无需任何本地安装。问你的智能体:“搜索与数据库相关的 AWS 技能。”有关在运行时发现技能的说明,请参阅 readme。
如果你更倾向于在托管的 JupyterLab 环境中工作,可以在预配置了镜像的 Amazon SageMaker Studio 中使用该技能。
步骤 1:打开 Amazon SageMaker Studio。 在目标 AWS 账户和 AWS 区域中导航到 Amazon SageMaker Studio。选择你的 Studio 域,并从用户配置文件启动 Studio IDE。
步骤 2:创建 JupyterLab space。 从 Studio 登录页面,选择 JupyterLab,然后选择“Create JupyterLab space”。为 space 命名(例如 my-inference-opt),并将共享设置保持为 Private(技能仅在 private spaces 上同步)。在 Image 菜单下,选择包含 SageMaker AI 优化生成式 AI 推理技能的镜像。该镜像预配置了 aws-ai-ml 智能体技能和所有必要的依赖项。选择“Run space”并等待其启动(首次启动需要 5–10 分钟)。
注意:使用一个全新的 space。已重用的 space 如果有本地修改过的技能版本,可能无法识别预配置的镜像。
步骤 3:打开 JupyterLab 并启动终端。 space 启动后,打开 JupyterLab 并选择 Terminal。
步骤 4:授权你的编程智能体。 在终端中,使用你的身份提供商向编程智能体进行身份验证。例如,使用 Kiro:
kiro-cli login --license pro --identity-provider <your-IdP-start-URL> --region us-east-1 --use-device-flow
步骤 5:确认并开始。 打开你的编程智能体的聊天面板,问:“有哪些可用的技能?”你应该能看到 aws-ai-ml 列出。确认后,用自然语言描述你的意图。
如果智能体报告没有可用的技能,请验证你的 space 是否设置为 Private。你也可以从终端检查:
ls ~/.kiro/skills/
如果该目录为空但 /etc/sagemaker/skills/ 包含技能文件,请运行 restart-jupyter-server,刷新页面,然后重试。
智能体体验涵盖推理优化生命周期中的以下功能。你不需要知道应该调用哪个功能。描述你想要什么,你的智能体会找出下一步,或者在不清楚时提出澄清问题。
如果你已经在 SageMaker AI 端点上部署了模型,可以要求智能体对其进行基准测试。告诉智能体你要测试哪个端点,它会生成一个 Python notebook,使用 SageMaker Python SDK 中的 Workload.synthetic() 和 start_benchmark() API 运行负载测试。
在运行任何基准测试之前,智能体会确认你的端点是否可以安全地进行负载测试,因为基准测试会向实时端点发送真实流量。
基准测试完成后,你会得到一份包含以下内容的定量性能报告:
这些是从真实基础设施的真实负载中测得的值,而非估算。智能体还会推荐改进机制(如 prefill 解码)来提升性能。
示例提示词:“对我的 Llama 端点在 SageMaker AI 上进行基准测试。”
如果你有一个模型,需要找到合适的实例类型将其部署在 SageMaker AI 上,请告诉你的智能体。你的模型在哪里或如何获取并不重要:
Fine-tuned 或自定义模型在 Amazon Simple Storage Service(Amazon S3)中:你训练或下载了一个模型并存储在 S3 中。提供 S3 URI 和你的优化目标。示例提示词:“我想找到最便宜的实例类型来在 SageMaker 上部署我的微调模型。”
Amazon SageMaker JumpStart 中公开可用的基础模型:你想从 JumpStart 目录部署一个基础模型(FM),然后提供模型 ID。示例提示词:“找出 huggingface-reasoning-qwen3-8b 模型在 SageMaker AI 上的最佳实例。”
Hugging Face Hub 上的模型:你想使用托管在 Hugging Face 上的模型。提供模型名称。对于 gated 模型(如 Llama 变体),你的智能体会显示许可条款,并要求你接受它们并提供你的 Hugging Face token。示例提示词:“我想从 Hugging Face Hub 部署一个 Llama 模型。最便宜的选择是什么?”
在每种情况下,你的智能体都会生成代码来针对候选实例和配置对你的模型进行评估,然后以具体性能指标呈现排名靠前的部署选项:吞吐量、延迟百分位数、首个 token 到达时间和并发。你根据成本和性能要求做出选择。
如果你运行了多个基准测试(例如,在配置变更前后,或跨两个实例类型),你可以要求智能体进行比较。提供两个基准测试任务名称,智能体会生成一份比较报告,计算关键指标的差异:吞吐量、延迟百分位数和首个 token 到达时间。
结果显示百分比变化,正值表示更好,让你对变更是提升了性能、降低了性能还是没有实质性影响有一个单一且可理解的总结。
如果其中一个基准测试运行不存在,智能体会建议先运行它,然后再进行比较。
示例提示词:“我有两个基准测试运行结果,想要比较它们。哪个更快?”

该表比较了相同基准测试工作负载(512/256 tokens,并发 4)下两个部署的模型。Δ% 列显示了 Model B(Qwen3-8B)在每个指标上比 Model A(Qwen3-1.7B)快多少。正值意味着 Model B 更好。
这两个模型运行在不同的硬件上。Qwen3-8B 使用 4-GPU ml.g5.12xlarge(4×A10G),而 Qwen3-1.7B 使用单个 L4 GPU(ml.g6.4xlarge)。差异反映的是大约 4 倍的计算资源,而不仅仅是模型本身的差异。
结论:Qwen3-8B 实现了约 44–47% 更高的吞吐量、更低的端到端延迟,这主要得益于额外的 GPU 计算资源。Qwen3-1.7B 仅在首个 token 到达时间上获胜,这是单 GPU 上较小模型的预期优势。
你不需要记住功能名称或知道请求哪个工作流。下表展示了常见请求如何映射到结果。
如果你的请求涉及多个功能(例如,准备一个 Hugging Face 模型然后获取部署推荐),智能体会在同一对话中自然地将它们串联起来。
配备了 aws-ai-ml skill 的智能体遵循一些使体验可预测且安全的的行为:
它会询问所需信息。 如果缺少信息(如端点名称或 S3 URI),智能体会要求你提供,而不是猜测。
在有影响的操作之前会确认。 在向实时端点发送真实流量运行基准测试之前,智能体会警告你其影响,并要求你明确确认。
它会告诉你某事超出范围。 如果你请求的内容是智能体无法做到的(如部署模型),它会解释它能提供什么替代方案,例如生成你需要的部署配置。
它生成 SageMaker Python SDK v3 代码。 每个输出都是可执行的代码,你可以在自己的环境中检查、修改和运行。
为避免产生持续费用,请删除你创建的资源:
aws-ai-ml skill for Amazon SageMaker AI 优化的生成式 AI 推理将你现有的编程智能体转变为 SageMaker AI 推理优化专家。无论你需要对实时端点进行基准测试、为模型找到最便宜的实例、比较配置,还是准备一个 Hugging Face 模型进行评估,你只需描述你想要什么,你的智能体就会交付可量化的结果。
要开始使用,请通过 AWS Agent Toolkit 安装该技能并将其添加到你已经使用的编程智能体中,或在 Amazon SageMaker Studio 中启动一个预配置的 JupyterLab space。有关更多信息,请参阅 Amazon SageMaker AI 文档。