详细解析如何在AgentCore上构建多租户代理架构,用MicroVM隔离、统一网关访问、Agent Skills标准快速扩展政策数字化能力并保留人工审查。
预先授权是健康计划在覆盖特定医疗服务或药品之前要求的审批流程。它仍然是医疗领域中最依赖人工处理的流程之一,并非因为要求审批的医学推理本身有缺陷,而是因为管理这一流程的政策被困在静态、非结构化的格式中,无法实现自动化。这些内容是日常临床运营的核心,每年影响数亿患者。然而,政策内容因临床领域、地理位置、业务线和健康计划而异,并随着医学和技术的进步而演变。历史上,健康计划没有系统性的方法来管理、分析和优化这些政策。将这些临床政策数字化为结构化、机器可读的数据,并使用标准术语,可以减少关键的运营瓶颈,支持更一致、可计算的工作流程,并帮助健康计划在保持适当临床监督的同时大规模现代化预先授权运营。
Cohere Health® 是一家为健康计划运营提供支持的临床智能公司,使用 Amazon Bedrock AgentCore 构建了 Cohere Policy Studio™,该平台提供了多租户隔离功能,满足其健康计划客户的需求,并提供了托管智能体运行时,无需重建基础设施即可加速部署。该应用采用灵活的、多租户的智能体架构,通过广泛的工作流管理和自动版本跟踪来加速政策数字化。
在这篇文章中,你将了解 Cohere Health 如何在 AgentCore 上使用 AgentCore Runtime 的安全 MicroVM 隔离、通过 AgentCore Gateway 统一工具访问、AgentCore Memory 和 Agent Skills 开放标准构建多租户智能体架构,从而在保持透明度、版本控制和人工监督的同时快速扩展政策数字化能力。
挑战:政策数字化的瓶颈
在预先授权中实现 AI 辅助工作流的价值取决于一个基础性挑战:将困在静态文档和 PDF 中的规则转换为结构化、机器可读的数据,使 AI 系统能够更一致地使用,同时在需要临床判断的地方由医学专业人员负责临床审查。健康计划面临着管理临床政策的复杂挑战,以支持快速变化的需求。自动化政策数字化有助于健康计划适应这些变化。
Cohere Health 在为此工作流构建 AI 解决方案时发现了三个挑战:
政府法规——根据美国医疗保险和医疗补助服务中心(CMS)法规,健康计划需要在 2027 年 1 月之前支持基于 API 的电子预先授权。
美国健康保险计划协会(AHIP)——AHIP 承诺要求健康计划实现电子预先授权提交的 80% 实时审批。每条业务线都有独特的要求,增加了快速管理、审计和部署临床政策的必要性。
技术架构需求——该解决方案需要摄取多种输入格式,并为不同的下游消费者产生不同表示形式,每个消费者都有自己的反馈循环。
AgentCore 通过托管运行时基础设施、会话隔离和统一工具访问来解决这些挑战。
下图展示了 Cohere Policy Studio 如何将 AgentCore Runtime、Gateway 和 Memory 连接成一个统一智能体系统,用于政策数字化。

Policy Studio 应用基于 AgentCore 构建,使用 Agent Skills 开放标准。为了在 Cohere Policy Studio 中扩展表示形式,Cohere Health 向一个已有的、正在分解政策的 AgentCore Runtime 添加了新技能。该运行时可以访问政策技能、作为 MCP 工具通过 AgentCore Gateway 访问的政策 API,以及用于政策分析师反馈循环的会话内存,帮助团队在治理化、人工介入的过程中优化输出。
团队完成了三个任务:
使用 LangChain 部署了包含 AgentCore Gateway 和 AgentCore Memory 的完整智能体系统 AgentCore Runtime。
配置了 AgentCore Gateway 以获取工具和技能。
与临床政策专家一起编写了技能,并使用基于 Arize AI 的 Cohere Health 标准化可观测性流程进行评估。
你可以应用这些相同的模式来构建自己的多租户智能体系统。
使用可复用的 Amazon Elastic Container Registry(Amazon ECR)基础镜像部署 AI 智能体
Cohere Health 为多个健康计划提供服务,这些健康计划需要严格的租户间数据隔离。AgentCore Runtime 的安全 MicroVM 隔离通过每个会话的专用计算、内存和文件系统资源来强制执行此隔离。
在跨团队部署多个 AI 智能体实例时,保持一致性同时允许定制化很重要。每个团队都需要自己的智能体配置,但每次部署都重建整个运行时环境会产生不必要的开销和漂移。你可以使用以下基础镜像模式将新智能体部署到 AgentCore Runtime MicroVM,最小化 Dockerfile。
Cohere Health 开发了两层部署架构,将稳定运行时环境与团队特定配置分离:
FROM {account_id}.dkr.ecr.{aws_region}.amazonaws.com/cohere-agent:v1
COPY agent_config.yaml /app/src/agent_config.yaml
FROM 行拉取包含 LangChain 智能体框架和公共依赖项的共享基础镜像。COPY 行添加团队特定的 agent_config.yaml,用于控制以下选项:
内存模式——在无状态(NO_MEMORY)或持久化(AGENTCORE)对话历史之间选择。
存储策略——full_trace 用于修正工作流,conversation_only 用于干净的历史记录。
会话上下文缓存——自动缓存技能定义和文档,避免冗余的 Amazon S3 获取。
提示缓存——可以通过缓存系统提示和常用内容来帮助降低成本和延迟。
灵活的工个配置——每个部署启用/禁用工具。
模型配置——基于 Amazon Bedrock 的基础模型,具有可配置的令牌限制、temperature 和其他推理参数。
LiteLLM 配置——将 LiteLLM 配置为模型和智能体之间的反向代理。
运行时部署完成后,下一步是将其连接到工具和技能。
通过 AgentCore Gateway 统一工具和技能访问
Cohere Health 的智能体访问多种工具类型,包括用于获取技能和文档的 AWS Lambda 函数,以及跨不同团队维护的内部 API。AgentCore Gateway 在单一认证端点后整合这些工具,使团队无需重新部署智能体即可添加新工具。
Cohere Health 使用 AgentCore Gateway 实现这一点,分别为共享工具和项目特定工具设置单独的目标。
AgentCore Gateway 为每个工具请求调用一个 AWS Lambda 函数。该函数根据传入网关上下文的工具名称路由到正确的处理程序。
# jobs/generic-tools-lambda/app.py
import json
from tools.fetch_skill import handler as fetch_skill_handler
# Routing dictionary for tool discovery
TOOL_HANDLERS = {
"fetch_skill": fetch_skill_handler
}
def lambda_handler(event, context):
"""Gateway-compliant Lambda handler with MCP routing"""
# Extract tool name from gateway context
tool_name = context.client_context.custom.get('bedrockAgentCoreToolName', '')
# Strip gateway prefix (gateway adds {target}__ to tool names)
if '__' in tool_name:
tool_name = tool_name.split('__', 1)[1]
# Route to appropriate handler
if tool_name not in TOOL_HANDLERS:
return {
"statusCode": 404,
"body": json.dumps({"error": f"Tool {tool_name} not found"})
}
try:
result = TOOL_HANDLERS[tool_name](event)
return {
"statusCode": 200,
"body": json.dumps(result)
}
except Exception as e:
return {
"statusCode": 500,
"body": json.dumps({"error": str(e)})
}
每个工具处理程序从特定来源获取数据。以下示例从 Amazon S3 检索技能定义。
# tools/fetch_skill.py
import boto3
import os
def handler(event: dict) -> dict:
"""Fetch skill definition from S3"""
skill_id = event.get('skill_id')
if not skill_id:
return {"error": "skill_id required"}
# 使用环境变量进行配置
```python
bucket = os.environ.get('SKILLS_BUCKET')
prefix = os.environ.get('SKILLS_PREFIX')
s3 = boto3.client('s3')
try:
response = s3.get_object(
Bucket=bucket,
Key=f"{prefix}/{skill_id}.yaml"
)
content = response['Body'].read().decode('utf-8')
return {"content": content}
except Exception as e:
return {"error": f"Failed to fetch skill: {str(e)}"}
智能体配置定义了智能体可以访问哪些网关目标及其认证方式。
# agent_config.yaml
mcp:
gateway_url: {gateway_url}
allowed_targets:
- generic-tools # AIP-maintained tools
- digitization-tools # Project-specific tools
auth_mode: "bearer_token"
运行时和工具就绪后,Cohere Health 开始构建领域专业知识层。
AI 智能体需要领域特定知识才能有效执行专业任务。通用提示词会产生不一致的结果,需要大量 token 使用,且缺乏领域专家带来的细致理解。每个新用例传统上都需要从头重建智能体基础设施,造成部署速度的瓶颈。模块化技能框架通过将领域专业知识与基础设施解耦来解决这个问题。对 Cohere Health 而言,这意味着临床政策专家可以直接编写和完善新技能,有助于确保系统以符合专家审查和治理的方式支持政策工作流。
团队通过模块化、版本化的技能定义部署新能力,无需重建智能体。
Cohere Health 遵循结构化工作流,在每个技能进入生产环境前进行开发和验证。
技能评估需要机器学习工程与数据科学之间的协作。流程从包含每个技能真实输出的参考数据集开始。团队定义成功指标(准确性、完整性、一致性),然后针对这些测试用例运行评估套件。当技能失败时,团队分析失败模式并在重新测试前迭代优化技能定义。
技能通过评估套件后,数据科学团队根据接受标准审查结果,并批准技能进入生产部署。
部署后,机器学习团队使用 Arize AI 追踪生产中的有效性指标。临床政策分析师对样本输出进行标注,以捕捉自动指标遗漏的错误。团队监控技能随时间的退化情况,并利用这些数据点来优先安排优化工作。
技能通过双层版本控制方案和分阶段部署流水线进入生产环境。
技能使用双层版本控制:语义版本号用于能力追踪,Amazon S3 对象版本用于部署历史记录。第一层在 SKILL.md 中追踪能力变更,在 git 中为每个版本打标签(例如 skill/policy_ingestion/v1.2.3)。Amazon S3 对象版本提供第二层,为每次上传维护不可变历史记录,支持回滚,并使用独立的非生产/生产桶。
开发者提交并打开指向 develop 的 PR。
持续集成和持续交付(CI/CD)在合并时将 skill.tar.gz 与元数据一起打包。
流水线上传到 Amazon S3 非生产桶并更新清单。
在非生产环境中评估。
通过渐进式发布和监控部署到生产环境。
通过这一实现,Cohere Health 在政策数字化速度、部署速度和覆盖率方面取得了可衡量的改进。
政策数字化效率:政策数字化总时间减少了 30%,从每项政策 2 小时 15 分钟减少到 1 小时 35 分钟。Cohere Health 至今已使用手动和半自动化工作流数字化了数千项政策。基于智能体的框架旨在随着现有政策库的扩展,进一步减少每项政策的处理时间。
部署速度:产品中的完整智能体部署从 3-4 个月减少到 2-6 周。可复用的 ECR 基础镜像模式让团队只需一个最小的 Dockerfile 就能启动新智能体,模块化技能框架意味着新能力无需重建智能体运行时即可发布。系统抽象了 DevOps 关注点,因此传统机器学习(ML)和数据科学工程师无需丰富的编码经验即可部署智能体。政策数字化产品运行单智能体、多技能架构,包含一个智能体、一个主技能及其子技能,以及三个引用注入。
政策覆盖率:Cohere Policy Studio 以逐字文本和标准编码证据层来表示政策内容,捆绑在一起,可在原始政策格式和来源中通用。
"事先授权政策审查始终需要非凡的临床关注——政策文档中的每个字都可能对患者产生下游影响。但这种关注在历史上被分割在解读和验证之间:不仅要理解政策在临床上的含义,还要确认哪个版本的政策管辖了某个决定,以及该健康计划向提供商发布的是否是同一版本。这些不是行政问题——它们直接影响临床完整性。Amazon Bedrock AgentCore 为我们提供了同时解决这两个问题的架构——AI 驱动的智能体工作流,协助处理临床语言的解读复杂性,内置记忆和版本追踪,使来源成为一等公民而非事后考虑。结构化、版本化的政策输出使决定的临床基础可追溯且可审查,AgentCore 的安全、多租户运行时意味着我们可以在不牺牲隔离性的前提下,为我们服务的每个健康计划提供这种能力。"
—— Brian Covino,M.D.,FAAOS,Cohere Health 首席医学官
应用这些模式来实现类似的结果:可复用的基础镜像用于一致部署,通过单一网关统一工具访问,以及可扩展而无需重建基础设施的模块化技能。
在 Cohere Policy Studio 基于 AgentCore 取得成功的基础上,下一阶段的演进引入了智能知识图谱,相关工作已经启动。Cohere Health 与 AWS 生成式 AI 创新中心合作,构建了映射临床政策到标准本体(UMLS、SNOMED)的基础语义层原型,以使用标准化医疗术语支持更大的互操作性。使用 Amazon Neptune,这为 AI 可以遍历和追踪的政策概念奠定了结构基础。该图谱将临床政策与跨扩展适应症的决策产品连接起来。
知识图谱层位于政策表示引擎与下游决策系统之间,创建一个语义网络,能够:
映射跨治疗领域之间政策、临床指南、医疗代码(ICD-10、CPT、HCPCS)、药品处方集和事先授权标准之间的关系。
通过识别跨临床领域的模式和相似性来扩展适应症覆盖率,使新政策类型无需手动配置即可快速部署。
将政策片段连接到多个决策上下文,使单一政策更新能够正确传播到受影响的授权工作流。
当新政策通过 AgentCore 数字化时,知识图谱旨在帮助识别相关连接、标记潜在冲突,并为审查人员和政策团队工作流建议可复用模式。图谱从跨临床领域的政策结构中学习,建议模板并将新适应症类型的部署时间从数天缩短到数小时。决策引擎使用自然语言或 FHIR(快速医疗互操作性资源)资源查询知识图谱,以检索具有完整来源和版本历史的潜在相关政策片段。图谱还维护 CMS 要求、AHIP 承诺与内部政策表示之间的双向链接,支持大规模监管对齐。
这些能力以不成比例的工程努力实现了全面的适应症覆盖,跨连接决策产品实现实时政策更新,自动冲突检测以帮助防止不一致的授权结果,以及用于授权请求的亚秒级政策检索。
这一知识图谱基础支持 Cohere Health 帮助健康计划实现 80% 的实时电子事先授权批准的能力。图谱维护了在当前 AgentCore 架构中建立的安全性、多租户和审计能力。
在这篇文章中,你了解了 Cohere Health 如何使用 AgentCore 和三个架构决策,将 AI 智能体部署周期从数月缩短到数周。三种模式(可复用的 ECR 基础镜像、通过 AgentCore Gateway 统一访问工具,以及模块化技能开发)帮助 Cohere Health 在支持更多可扩展的策略数字化工作流的同时,将数字化时间减少了 30%。
ECR 基础镜像模式消除了冗余的基础设施工作,使团队能够通过一个最小的 Dockerfile 部署新的 AI 智能体。Cohere Health 可以在不重建运行时的情况下扩展 AI 系统。AgentCore Gateway 架构为工具提供了单一的身份验证端点,无论这些工具是基于 AWS Lambda 的工具还是 OpenAPI 服务。技能框架基于 Agent Skills 开放标准,将领域专业知识与智能体机制分离,通过 Arize AI 和临床策略分析师的持续评估支持快速迭代。
医疗 AI 的未来取决于能够快速适应不断变化的需求同时保持可靠性和安全性的系统。借助 AgentCore 和这些架构模式,你现在就可以构建这样的系统。
要在你自己的环境中开始使用这些模式,请探索以下资源:
了解更多关于 Cohere Health 的信息,并试用 Cohere Policy Studio。
阅读 Amazon Bedrock AgentCore 开发者指南,部署你的第一个 AI 智能体运行时。
设置 AgentCore Gateway 以通过 MCP 兼容性实现统一的工具访问。
采用 Agent Skills 开放标准,实现可维护的版本化领域专业知识。
查看 AgentCore 接口指南,为你的用例选择合适的 SDK 和框架。
在这个 re:Invent 演讲中了解 Cohere Health 另一个 AgentCore 部署——医疗必要性审查 AI 智能体助手。

如果你是一家正在构建生产级 AI 智能体的初创公司,AWS Activate 提供积分、技术指导和架构支持,帮助你从原型过渡到生产环境。立即开始。
如果你对这篇文章有反馈或问题,请在评论区留言。