文章梳理从 Bedrock 单智能体到 AgentCore 多智能体编排的完整技术栈,并覆盖工具调用、运行基础设施与生产安全护栏。核心是将“规划—执行—观察—纠正”闭环落地到 AWS 应用。
2026 年,AI 已经从“回答问题”迈向“采取行动”。Agentic AI——能够自主规划、推理、使用工具并执行多步骤任务的系统——已经成为在 AWS 上构建智能应用的主流模式。
本文将介绍 AWS 上完整的 Agentic AI 技术栈:从单 Agent 基础、多 Agent 编排,到承载这些 Agent 的基础设施,以及保障它们在生产环境中安全运行的 Guardrails。
传统 AI:用户提出问题 → 模型生成答案 → 结束。
Agentic AI:用户描述目标 → Agent 规划步骤 → Agent 调用工具 → Agent 评估结果 → Agent 迭代执行 → 实现目标。
二者的区别在于自主性。Agent 会自行决定该做什么、执行相应操作并进行自我纠正,无需人类在每一步介入。
┌─────────────────────────────────────────────────────────────┐
│ AGENTIC AI LOOP │
│ │
│ User Goal → Plan → Act → Observe → Reason → Act → Done │
│ ↑ │ │
│ └───────── iterate ──────────────┘ │
└─────────────────────────────────────────────────────────────┘
┌─────────────────────────────────────────────────────────────────┐
│ APPLICATION LAYER │
│ Amazon Q (Business & Developer) | Custom agents via Bedrock │
├─────────────────────────────────────────────────────────────────┤
│ AGENT FRAMEWORKS │
│ Bedrock Agents | Strands Agents SDK | LangGraph on AgentCore │
├─────────────────────────────────────────────────────────────────┤
│ AGENT INFRASTRUCTURE (AgentCore) │
│ Runtime | Memory | Identity | Observability | Code Interpreter │
├─────────────────────────────────────────────────────────────────┤
│ TOOLS & KNOWLEDGE │
│ AgentCore Gateway (MCP) | Knowledge Bases (RAG) | Action Groups│
├─────────────────────────────────────────────────────────────────┤
│ SAFETY & GOVERNANCE │
│ Guardrails | IAM | CloudTrail | Model Evaluation │
├─────────────────────────────────────────────────────────────────┤
│ FOUNDATION MODELS │
│ Claude | Nova | Llama | Mistral | DeepSeek (via Bedrock) │
└─────────────────────────────────────────────────────────────────┘
Bedrock Agents 是构建 AI Agent 的全托管方案。你只需定义 Agent 的指令,连接工具和知识,Bedrock 就会负责处理编排循环,也就是 ReAct 风格的推理过程。
用户向 Agent 发送消息。
Agent 的基础模型根据指令和上下文,推理接下来应该做什么。
Agent 决定调用工具(Action Group),或者查询知识(RAG)。
工具执行操作并返回结果。
Agent 评估结果,判断目标是否已经实现,或者是否还需要执行更多步骤。
重复上述过程,直到实现目标或达到最大迭代次数。
Agent 向用户返回最终响应。
选择模型:复杂推理可以使用 Claude Sonnet 或 Nova Pro。简单的路由 Agent 可以使用 Haiku 或 Nova Micro。
指令设计:明确说明 Agent 的角色、不应该做什么,以及遇到歧义时应该如何处理。模糊的指令会导致不可预测的行为。
工具设计:每个工具都应该专注做好一件事。工具名称必须清晰,因为模型会根据名称和描述判断何时调用它们。同时还要提供输入和输出 schema。
# Example: Defining an action group tool
{
"actionGroupName": "OrderManagement",
"description": "Manages customer orders - lookup, modify, cancel",
"apiSchema": {
"payload": "openapi-schema.json"
},
"actionGroupExecutor": {
"lambda": "arn:aws:lambda:us-east-1:123456789:function:order-api"
}
}
面对复杂问题时,单个 Agent 往往不够。多 Agent 协作可以让多个专业 Agent 分工配合。
┌──────────────────┐
│ Supervisor Agent │
User ────────→│ (Routes tasks) │
└────────┬─────────┘
│
┌──────────────┼──────────────┐
│ │ │
▼ ▼ ▼
┌──────────────┐ ┌───────────┐ ┌──────────────┐
│ Research Agent│ │ Code Agent│ │ Review Agent │
│ (RAG + Web) │ │ (CodeGen) │ │ (Validation) │
└──────────────┘ └───────────┘ └──────────────┘
Supervisor Agent——接收用户请求、分析任务复杂度,并将任务路由给专业 Agent。
Collaborator Agent——每个 Agent 都拥有特定的工具和知识,负责执行各自擅长的任务,然后将结果返回给 Supervisor。
Supervisor 汇总——将各个 Collaborator 的输出整合为最终响应。
经验法则:如果一个 Agent 需要使用 10 个以上的工具,或者承担 3 种以上彼此不同的职责,就应该将其拆分成多个 Agent。
AgentCore 是用于大规模部署 Agent 的运行时基础设施。它提供了 Agent 在生产环境中所需的那些“乏味但至关重要”的能力。
Gateway 尤其强大。它可以将现有 API 转换为工具,让任何 Agent 都能通过 Model Context Protocol(MCP)发现并使用这些工具:
将 Gateway 指向 OpenAPI spec 或 Lambda function。
Gateway 自动生成兼容 MCP 的工具定义。
Agent 在运行时发现工具,无需 hard-coding。
安全性:基于 IAM 对每个工具实施访问控制。
这意味着 Agent 无需将工具直接内置在代码中。它们可以动态发现能力:只需向 Gateway 添加一个新 API,所有与之连接的 Agent 就能立即使用。
对于希望获得更多控制权的团队,AWS 发布了 Strands Agents SDK。这是一个用于构建 Agent 的开源 Python 框架,可以运行在 AgentCore 上:
与模型无关——可以配合任意 Bedrock 模型或外部模型使用。
工具优先——通过 @tool decorator 定义工具,并自动生成 schema。
内置 Memory——与 AgentCore Memory 集成,实现持久化。
原生支持 MCP——在运行时从 MCP server 发现工具。
可观测——内置 tracing,并与 AgentCore Observability 兼容。
from strands import Agent, tool
from strands.models.bedrock import BedrockModel
@tool
def get_weather(city: str) -> str:
"""Get current weather for a city."""
# Call weather API
return f"Weather in {city}: 22°C, sunny"
@tool
def create_ticket(title: str, priority: str) -> str:
"""Create a support ticket in the ticketing system."""
# Call ticketing API
return f"Created ticket: {title} (priority: {priority})"
agent = Agent(
model=BedrockModel(model_id="anthropic.claude-sonnet-4-20250514"),
tools=[get_weather, create_ticket],
system_prompt="You are a helpful assistant that can check weather and create tickets."
)
response = agent("Check the weather in London and create a ticket if it's raining")
没有知识支撑,Agent 就会产生幻觉。Knowledge Bases 提供了 RAG(Retrieval-Augmented Generation)能力:
摄取——将文档(PDF、HTML、Markdown、Word、CSV)上传到 S3。
分块和嵌入——Knowledge Base 将文档拆分成多个 chunk,并生成 embedding。
存储——将 embedding 存储到 vector database 中,可以使用 OpenSearch Serverless、Aurora、Pinecone 或 Managed KB。
检索——当 Agent 需要信息时,系统会检索相关 chunk,并将其注入 prompt。
生成——模型根据检索到的事实生成响应。
这是最新的选择,无需预置任何资源,即可使用完全托管的 RAG:
无需管理 vector database。
检索能力自动扩缩容。
支持多模态摄取,包括文本、图像和表格。
内置 re-ranking,提高相关性。
Agentic retrieval,可跨文档进行多跳推理。
能够执行操作的 Agent 必须受到安全边界约束。Bedrock Guardrails 提供了以下能力:
Guardrails 可以附加到:
Agent 本身,对所有交互进行过滤。
特定的 Knowledge Base 查询。
Bedrock Flow 中的单个节点。
关键要点:必须同时对输入(用户发送的内容)和输出(Agent 返回的内容)应用 Guardrails。用户可能会精心构造 prompt 来绕过指令,而 Guardrails 正是应对这类风险的防御层。
最适合:客户支持、跨领域查询。由一个 Supervisor 将任务路由给专业 Worker,Worker 之间不直接通信。
最适合:文档处理、内容创作。Agent A → Agent B → Agent C,每个阶段都会进一步丰富输出。
最适合:研究任务、从多个来源收集数据。多个 Agent 同时工作,最后汇总结果。
最适合:高风险决策、代码审查。Generator Agent 生成输出,Critic Agent 评估质量,双方反复迭代,直到满足标准。
将 Agent 部署到生产环境之前,需要检查以下事项:
[ ] 已配置 Guardrails——内容过滤器、禁止主题和 PII masking。
[ ] 已限定 IAM 范围——Agent 的 execution role 只拥有完成任务所需的最小权限。
[ ] 已限制工具权限——每个工具只能访问特定资源。
[ ] 已启用 Observability——记录每次 Agent 调用的 trace,以便调试失败的推理过程。
[ ] 已设置成本控制——限制每次调用的最大迭代次数和 token budget。
[ ] 已定义 fallback 行为——当 Agent 无法解决问题时,应该怎么处理?
[ ] 已设置 human-in-the-loop——对于删除、购买、部署等高影响操作,必须要求人工审批。
[ ] 已完成测试——在生产部署前,使用已知的正确和错误输入进行评估。
[ ] 已配置 rate limiting——防止失控的 Agent 向 API 发送海量请求。
[ ] 已建立 audit trail——使用 CloudTrail 记录所有 Agent 操作和工具调用。
AWS 上的 Agentic AI 领域正在快速演进:
Bedrock Flows——通过可视化构建器串联 Agent、prompt 和条件,无需编写代码。
Agent-to-agent communication——Agent 可以自主发现其他 Agent,并将任务委派给它们。
Long-running Agent——Agent 可以跨数小时甚至数天持续运行,而不再局限于简单的 request-response。
AgentCore Memory 改进——提供包含实体关系的结构化 Memory,而不只是保存对话历史。
MCP 生态系统增长——为数据库、API、SaaS 平台等常用服务提供更多预构建的 tool server。
2026 年在 AWS 上构建 Agentic AI:
从 Bedrock Agents 开始,使用托管式编排——原型开发速度快,并且已经具备生产就绪能力。
当你需要自定义编排逻辑或高级模式时,使用 Strands SDK。
将 Agent 部署到 AgentCore,获得生产级基础设施能力,包括 Memory、Identity 和 Observability。
通过 AgentCore Gateway 连接工具——基于 MCP 动态发现,无需 hard-coding。
使用 Knowledge Bases 提供事实依据——RAG 可以防止幻觉。
使用 Guardrails 提供保护——在每次交互中执行内容过滤、PII masking 和 grounding check。
通过多 Agent 模式实现扩展——复杂领域使用 Supervisor-Worker,需要顺序处理的任务使用 Pipeline。
从“能够回答问题的 chatbot”到“能够采取行动的 Agent”,是 2026 年云端 AI 最具代表性的转变。基础设施已经准备就绪,接下来的问题是:你要在它之上构建什么?
Alpesh Kumbhare 是 Atos 的 AWS Architect,专注于 AWS 基础设施自动化和云端 AI 解决方案。你可以在 LinkedIn 上与他联系。
如果需要采取进一步措施,可以考虑屏蔽此人和/或举报滥用行为。