AWS ML Blog发布38个针对医疗和生命科学领域的开源Agent技能,覆盖11个细分方向,可将AI引用指南的正确率从基准提升至70-86%,附410道评测题和完整安装步骤。
基于基础模型(FM)构建的 AI 智能体在医疗与生命科学(HCLS)决策框架的应用上常常出错,即使它们已在训练数据和系统提示词中见过相关指南也不例外。让一个智能体使用 ACMG/AMP 标准对 TP53 错义突变进行分类,它会正确引用框架,但在证据类别应用上出错、跳过人群频率阈值、或虚构计算预测评分。模型知道事实,但缺乏领域从业者通过多年训练内化的结构化推理流程。这一差距在突变解读、保险理赔审核、临床试验设计和影像分析等场景中产生静默失败。输出看起来正确,但应用了错误的标准,带来监管和患者安全方面的后果。
本文分享了一套包含 38 个开源智能体技能的集合,跨越 11 个 HCLS 领域,帮助弥合这一方法论差距。我们将逐步介绍安装方法,展示如何在智能体 AI 服务中使用它们,并分享评估结果,以证明在药物发现、医疗运营和医学影像工作流中可衡量的改进。配备这些技能的智能体在头对头比较中,以 70–86% 的胜率击败未配备技能的同一智能体(因智能体测试框架设置不同而有差异)。最显著的效果体现在批判性思维方面(胜率 78–85%,效应量 d = 0.65–1.03)。我们还将展示如何为特定用例定制、扩展和创建自己的智能体技能。
HCLS 智能体技能集合中的技能是结构化的 markdown 文档(SKILL.md),通过渐进式披露的方式将领域决策流程编码为 AI 智能体在推理时可消费的格式。按照 Agent Skills 开放标准,每个技能在 YAML frontmatter 中声明触发器、依赖项和元数据。后续内容包含决策框架、参数表、代码模式和验证标准。该集合涵盖跨越 11 个 HCLS 领域(包括基因组学、药物发现、保险理赔运营和医学影像)的 38 个技能。完整列表按领域组织的技能目录见此。全部以 MIT-0 许可证发布。
该仓库中的技能分为推理技能和流水线技能两类。推理技能编码指导智能体思维方式的方法论和决策框架。例如,genomic-variant-interpretation 技能编码了完整的 ACMG/AMP 分类框架,包括证据类别、人群频率阈值和计算预测因子 cutoff 值。流水线技能编码特定工具的命令、经验证的参数和生成可运行产物的代码模板。variant-calling 技能提供带有正确注释组、VQSR tranche 敏感性目标和 Mutect2 肿瘤-正常配置的 GATK4 HaplotypeCaller 命令。
这一双重分类为智能体提供了正确决策的判断力和执行技术动作的精确性。与检索增强生成(RAG)不同——RAG 从索引文档中检索有限段落以增强响应生成——技能本身编码了决策流程和错误条件。技能也不是微调。它们是基于用户查询中的触发模式在上下文中激活的结构化提示。
三个特性使技能区别于其他领域专业化的方法。技能是可审计的、可移植的,并且易于维护。每条决策标准都以人类可读的 markdown 格式呈现,而非隐藏在模型权重中。一种技能无需为每个服务定制即可跨 20 多种服务工作(Amazon Bedrock AgentCore、AWS Strands Agents SDK、Kiro、Amazon Quick Desktop、Claude Code、OpenAI Codex 等)。年度医疗政策变更或新的实验标准可以通过编辑文本文件快速反映,而无需重新训练模型。
现在你已了解技能的内容,接下来设置它们。
要跟随本文中的示例,你需要以下支持的 AWS 服务之一:Kiro 或 Kiro CLI 用于交互式技能使用和多智能体编排、具有 Amazon Bedrock 基础模型访问权限的 AWS Strands Agents SDK、AgentCore 测试框架(Amazon Bedrock AgentCore 的一项功能,提供现有智能体实现)、或用于基于 GUI 技能管理的 Quick Desktop。你也可以使用自己选择的编码智能体测试框架,如 Claude Code 或 OpenAI Codex。还需要 Python 3.10+(带有 uv)和用于克隆仓库的 Git。
首先克隆仓库:
git clone https://github.com/awslabs/hcls-agent-skills.git
cd hcls-agent-skills
若仅安装技能而不安装智能体配置,使用通用技能 CLI:
npx skills add awslabs/hcls-agent-skills
对于 Kiro,install.sh 脚本同时安装技能和一个预配置的智能体来配备它们。智能体自动处理技能路由,因此无需按名称调用单个技能。运行 ./install.sh --target kiro,然后在 Kiro CLI 中用 /agent hcls 切换到该智能体。对于多智能体模式,运行 ./install.sh --target kiro --mode multiagent 并使用 /agent hcls-multiagent。
对于 AWS Strands Agents SDK,在 Python 代码中直接加载技能:
from strands import Agent
from strands.skills import AgentSkills
agent = Agent(
model=model_id,
skills=AgentSkills(skills="./skills/"),
)
对于 AgentCore,按照将智能体技能添加到 AgentCore 托管智能体的说明操作。AgentCore 提供托管托管、自动扩缩容、安全边界和可观测性能力。
对于 Amazon Quick Desktop,运行 ./install.sh --target quick-desktop 查看在图形界面中添加技能的完整说明。或者按照 Amazon Quick 文档中技能的说明操作。
安装技能后,我们演示三种部署模式:Quick Desktop 中最简单的单智能体方案、Kiro CLI 中解决上下文工程挑战的多智能体编排、以及在 Amazon Bedrock AgentCore 上使用 Strands SDK 的生产部署。然后我们展示三个示例用例,突出技能在真实 HCLS 工作流中产生的可衡量差异。
Quick Desktop 中的智能体技能实战
安装技能后,Quick Desktop 的智能体无需额外配置即可获得结构化的 HCLS 领域推理。当用户提出领域问题时,智能体根据查询中的触发模式自动激活相关技能。例如,问"编码 E11.9 而不是 E11.42 的 RAF 影响是什么?"会触发风险调整技能,智能体返回具体的 HCC 映射、层级解析和量化的 RAF 增量,而非"请查阅文档"的通用建议。技能是有选择性地激活的。只有相关技能会被触发来生成响应,有助于保持输出的专注和准确。下图视频展示了一个技能在 Amazon Quick Desktop 中针对该问题动态加载的过程。
Amazon Quick Desktop 中风险调整技能动态加载以响应 RAF 编码问题的聊天界面
Kiro 的多智能体架构
将全部 38 个技能加载到单个智能体上下文中消耗约 80K token。这对于大上下文模型是可行的,但带来了上下文工程挑战。智能体必须在每个查询中从 38 个可用技能中选择正确的子集,不相关的技能内容会争夺注意力。另一种方案是显式技能调用(例如 /risk-adjustment),但这要求你在提问之前就知道要调用哪个技能,而这正是技能设计要弥补的专业知识差距。
Kiro CLI 的多智能体架构同时解决了这两个问题。一个轻量级协调智能体(不加载技能)将查询路由到八个领域专家,每个专家只加载其相关技能(每个专家约 15K token)。协调智能体处理意图分类,而专家处理领域推理。专业化分工定义如下表所示。
Kiro CLI 多智能体架构中八个领域专家智能体及其分配技能表

多智能体配置在 JSON 智能体文件中定义。路由逻辑见协调智能体配置,领域技能如何附加到专家的配置示例见专家智能体配置。下图视频展示了多智能体和动态技能激活在 Kiro CLI 中处理代码库中的复杂药物重定位问题。
Kiro CLI 在代码库中使用多智能体路由和动态技能激活回答药物重定位问题
Strands SDK 集成
AWS Strands Agents SDK 为构建自定义 HCLS 智能体提供原生技能加载功能:
部署到 Amazon Bedrock AgentCore
在本地完成技能配备的智能体开发后,你可以将其投入生产。Amazon Bedrock AgentCore 提供了一条替代路径,将技能注入托管的智能体。除了将技能嵌入 Strands 智能体代码外,你还可以在环境级别配置技能,使运行在该工具中的智能体都能使用这些技能。AgentCore 工具提供托管服务、自动扩展、安全边界和可观测性能力,无需管理基础设施。详见 AgentCore 文档中的 Skills。
部署部分介绍完毕,下面来看技能配备的智能体在实践中的表现。以下示例用例摘自我们的评估提示集。
用例 1:在药物发现中评估特发性肺纤维化罕见病的再定位候选药物
一家正在研究特发性肺纤维化(IPF)药物再定位的生物技术公司团队,希望评估通过受体激酶 TGFBR1(ALK5)调节 TGF-β1 信号通路的已批准药物。在实践中,研究人员需要查询药物-基因相互作用数据库、按证据强度对候选药物进行排序、评估作用机制与 IPF 病理生理学的重叠程度,并判断现有安全数据下的临床转化可行性。然而,研究人员可能只会给智能体一个模糊的提示:"我正在研究 TGFBR1 作为 IPF 的治疗靶点。有哪些已批准药物值得重新定位?最强候选药物是什么?临床转化的可能性有多大?"
在添加技能之前,智能体提供的是一般性文献综述,列出已知的 TGFBR1 抑制剂,缺乏结构化的排序标准、证据层次或转化评估框架。在为智能体配备技能后,智能体触发药物再定位和转化研究技能,做法如下:
智能体应用 DGIdb 查询框架,优先考虑相互作用类型(抑制剂 > 调节剂 > 结合剂)和来源数据库(ChEMBL、DrugBank),而非低置信度来源。
它使用结构化的证据层次对候选药物进行排序:直接靶点参与优于通路层面的证据,通路层面证据优于表型关联,现有适应症相关性作为调整因子。
它通过将 TGFBR1 抑制映射到关键 IPF 病理过程来评估作用机制重叠:成纤维细胞向肌成纤维细胞转化、上皮-间质转化和细胞外基质沉积。
它使用 T0→T1 标准评估临床转化可行性,检查原始适应症的现有安全数据、治疗窗口兼容性以及现有临床前纤维化模型与人类疾病之间的一致性。
技能链将表面层次的响应转化为结构化的、具备监管意识的评估,并带有量化的证据排名。
用例 2:在医疗索赔运营中构建 CMS-HCC 风险调整管道
一个拥有 12,000 名成员的 Medicare Advantage 计划,需要使用 CMS-HCC Model V28 系数从 ICD-10 诊断索赔数据中计算风险调整因子(RAF)分数。该管道必须应用 ICD-10 到 HCC 的交叉对照表、正确解决疾病层次结构,并计算带有人口统计学调整的最终成员级别风险分数。然而,一位初级分析师可能只会给智能体一个提示:"我们是一个拥有 12,000 名成员的 Medicare Advantage 计划。我们在 PostgreSQL 数据库中有 ICD-10 诊断索赔(member_diagnoses 和 member_demographics 表)。帮我构建一个计算当前支付年度成员级别 RAF 分数的管道。"
在添加技能之前,智能体生成的管道看似合理但不完整,常常完全缺少层次结构解析,使用过时的 V24 系数,或在求和之后才应用层次结构(这会导致分数膨胀)。在为智能体配备技能后,智能体触发风险调整和索赔计费规则技能,做法如下:
智能体生成正确的 SQL,将诊断代码连接到 ICD-10 到 HCC 的交叉对照表,并在测量年度内进行去重,确保每个 HCC 在每个成员中只计算一次。
它正确实现了 V28 层次结构解析,其中 HCC 18(伴有慢性并发症的糖尿病)优先于 HCC 19(无并发症的糖尿病),HCC 326(第 5 期 CKD)优先于 HCC 327(第 4 期 CKD),有助于防止在多个特异性层次上的重复计算。
它在求和 HCC 系数之前,先按社区、机构或双重符合资格人群对成员进行正确的人口统计学分层,并进行年龄/性别调整。
它主动解释跳过层次结构解析会在多个特异性层次上重复计算疾病状态,系统性地膨胀 RAF 分数,在 CMS RADV 审查下造成审计责任。
该技能支持生成可防御审计的 RAF 分数,而非会被触发 CMS RADV 审计结果的膨胀估计值。
用例 3:用于医学影像研究中基于体素的形态学分析的 T1 加权 MRI 预处理
一项针对 45 名健康成人的神经影像研究需要一个标准的 T1w 预处理管道,用于基于体素的形态学分析(VBM)。原始 DICOM 数据已转换为 NIfTI。该管道必须按正确顺序并使用适合健康成人大脑在 FSL/ANTs 混合环境中的参数进行重定向、偏置场校正、颅骨剥离和配准到 MNI152 空间。一位研究人员可能只会给智能体一个提示:"我有 45 个健康成人的 T1w 扫描,需要为 VBM 分析进行预处理。使用 FSL 和 ANTs 构建一个管道。"
在添加技能之前,智能体建议的管道看似合理,但可能将偏置校正排在颅骨剥离之后(这会使脑掩膜产生偏差),使用不恰当的阈值,或缺少故障模式检测策略。在为智能体配备技能后,智能体触发放射学预处理和影像研究设计技能,做法如下:
智能体指定了正确的处理顺序并给出理由:先重定向到标准空间,然后在颅骨剥离之前进行偏置场校正,再用针对健康成人调优的参数进行脑提取,最后配准到 MNI152 模板。
它解释了关键的处理顺序依赖性。如果偏置校正未先执行,脑边缘的强度不均匀性会导致颅骨剥离算法去除过多或过少的组织,特别是在颞叶和额叶区域。
它提供了完整的 bash 脚本,每个阶段都有错误检查和质量控制输出,用于目视检查中间结果。
它记录了每个步骤的故障模式:方向元数据不正确、表面线圈附近残留信号阴影、提取阈值过于宽松时包含颈部组织,以及老年受试者脑室边界处的配准失败。
该技能捕获了会在 VBM 分析中引入系统性偏差的顺序依赖性。
这些用例说明了 HCLS 技能如何从质上重塑智能体行为,以产生更具领域针对性的响应,但对于研究人员和开发者来说,总会有一个问题:技能到底好了多少?
我们进行了成对评估,以衡量技能在 410 个领域提示(380 个单技能和 30 个跨技能)上跨两种工具配置的影响。两个工具配置之一是 Kiro CLI,其中使用 Auto 模型让 Kiro 为任务选择最优模型。该 Kiro 智能体可以访问思维工具和文件读取操作。另一个工具配置是使用 AWS Strands Agents SDK 构建的智能体,采用 Agent(model=BedrockModel(...), callback_handler=None),模型明确固定为 Claude Sonnet 4.6。技能条件额外加载了 AgentSkills(skills="./skills/") 插件。两个条件都对称地提供了思维工具。配置可在 eval/execute.py 中找到。在两种配置中,比较了两个条件:一个是不访问任何技能的基础智能体,另一个是配备技能的智能体,通过渐进式加载调用所有 38 项技能。
我们采用五个评分维度来衡量大语言模型(LLM)评判者在技能如何影响智能体响应方面的表现。科学准确性评估事实、机制、引用和领域知识的正确性。连贯性评估响应是否遵循逻辑结构,具有清晰的推理链和内部一致性。相关性衡量智能体在紧扣主题的同时,以适当的深度回答提示的所有部分。批判性思维捕捉智能体挑战假设、识别局限性和考虑替代方案的能力,而非呈现单一未经审查的响应。可操作性评估智能体提供具体的后续步骤、特定参数和可执行命令的能力,从业者可以立即据此行动。我们使用 Amazon Bedrock 上的 Claude Opus 4.7 作为评判者。完整评分提示词见 eval/judge.py。
评判者对每个维度给出 0–100 的评分。然而,LLM 评判者表现出分数压缩现象,即分数聚集在某一范围内,使得原始增量(例如 +1.5)难以解释。因此我们报告两个主要指标。首先是胜率(WR),即技能条件得分高于基线的提示百分比,这是一个直观的度量指标,对量表压缩具有稳健性。其次是 Cohen's d 效应量(简称 d),用于衡量两组均值之间的标准化差异,计算方式为均值增量除以合并标准差。这衡量的是相对于自然方差的改进幅度。Cohen's d 的一般解释为 0.2(小)、0.5(中)、0.8(大)。
总体而言,在两种智能体测试框架配置中,技能在 69.5–85.9% 的正面比较中获胜。技能在两种配置中都改善了批判性思维、可操作性和科学准确性。最强的信号来自批判性思维,证实了技能的主要贡献是方法论的:教智能体应用哪些框架、挑战哪些假设、标记哪些局限性,而非添加基础模型可能已具备的事实内容。下表总结了高层级结果。
有强有力的证据表明,当基础智能体表现最差时,智能体技能的帮助最大。基线响应质量与技能收益之间的 Pearson 相关系数在 Kiro CLI 中为 −0.59,在 Strands 智能体中为 −0.61。我们根据基线智能体的总体得分将提示分为三个层级:弱、中、强。大多数提示落在技能提供明显收益的中等层级。落在模型已表现良好的强层级的提示,从智能体技能中获得边际改进。弱层级代表基础智能体难以处理的情况。这些情况跨越多个领域(临床数据、医疗保健运营、基因组学),通常涉及多步监管流程或模型近似而非精确应用的小众方法论。
然而,强层级发现并非绝对。跨领域推理技能即使在 90.2 的强基线下也达到了 80% 的胜率,表明精心设计的方法论框架在教模型应用其本身不会主动使用的决策程序时,在整个质量谱上都具有价值。
基线和有技能智能体按基线强度划分的总体得分见下表。
技能还降低了域内所有样本提示响应分数的标准差。例如,在 Kiro CLI 中加载技能后,临床数据响应的评判者分数标准差从 6.8 降至 3.3,降幅达 51%。这意味着技能使输出更加一致,遵守技能中编码的知识和框架。在受监管的 HCLS 工作流中,一致性与平均质量同样重要,这种方差缩减是一个有意义的好处。
完整的评估方法、提示词和原始结果可在评估技术报告中获取。
扩展技能和构建新技能
这些结果是针对代码库中交付的 38 个技能。团队的工作流可能需要不同的阈值、额外的协议或全新的领域覆盖。代码库包含三份技能定制指南:
CUSTOMIZING.md 涵盖了修改、扩展和从头创建技能的实用工作流,包括向现有技能添加组织特定规则(LCD 代码、处方步骤疗法、内部协议)。
SKILL_DESIGN_GUIDE.md 记录了编写有效技能的循证模式:决策树、阈值表、避坑清单、响应格式部分以及与高评估胜率相关的结构特征。
QUALITY_CHECKLIST.md 提供了涵盖前言、结构、内容质量和测试要求的提交前质量检查清单。
要为你的组织定制技能,首先复制相关的 SKILL.md,然后修改决策阈值、添加组织特定协议或移除无关部分。使用设计指南来构建新内容以获得最佳结果。例如,推理技能受益于决策树和编号步骤,而管道技能在参数表和版本特定避坑方面具有很强价值。
要测试你的更改,首先生成反映团队实际工作流的评估提示词,然后运行评估框架:
uv venv --python 3.12 && source .venv/bin/activate
uv pip install -e ".[dev]"
# 为每个技能生成 30 个评估提示词
python eval/generate_prompts.py --count 30
# 针对修改后的技能运行成对评估
python -m eval.run --skills ./my-custom-skills/ --parallel 2
python eval/build_review.py
open eval/results/review.html
以下视频展示了 review.html 评估仪表板,包括每次评估的评分、领域细分、提示词和响应。
显示每次评估的评分、领域细分、提示词和响应的 review.html 评估仪表板
评估产生一个成对比较,显示你的修改后的技能是否