医疗企业Guardoc利用Amazon Nova模型处理临床文档,自动化提取和整理长期护理数据。
每天,护士和护理团队都需要依据临床文档做出关键决策,而这些文档往往零散、不一致且容易出错。记录不完整或不准确会增加认知负担、引入临床风险,并在本就要求严苛的工作环境中带来合规挑战。医疗文档必须同时服务于患者治疗结果和监管标准,但实际情况却常常两方面都未能达标。
Guardoc Health 的使命是充分释放医疗数据的价值:通过促进准确、完整且符合合规要求的临床文档记录,帮助护士和护理团队提供更安全、更高质量的护理。在本文中,我们将探讨 Guardoc Health 如何使用通过 Amazon Bedrock 提供的 Amazon Nova 模型系列,变革长期护理领域的临床文档处理方式。
借助 Amazon Nova 模型,Guardoc Health 帮助专业护理机构和辅助生活中心以比人工审核更快、更准确的方式,从复杂文档中提取信息、进行分类并采取行动。这种方法有助于医疗机构减少美国每年在人工文档处理方面花费的数亿美元。Guardoc 报告称,文档错误减少了 46%,审计罚款减少了 70%,单个机构每年的投资回报(ROI)超过 40 万美元。
医疗记录会以各种可以想象到的格式出现。一天之内,一家医疗机构可能需要处理:
多页 PDF,其中手写的医生批注与印刷文本并存。
事先授权表单,其中复选框的状态决定是否批准保险给付。事先授权表单是由医生或药剂师填写的文档,用于让健康保险计划批准某些医疗服务、医疗程序或药物。
嵌入表格、自由文本或扫描图像中的用药清单。
同时包含打印字段、手写内容和橡皮图章的患者登记表。
根据发表于《BMJ Quality and Safety》¹ 的研究,在门诊护理中,诊断错误每年影响约 1,200 万美国成年人,而信息处理失误被认定为其中一个促成因素。Guardoc Health 正是为解决这一变量而构建的。对 Guardoc Health 而言,挑战在于同时兼顾规模与精度。在高峰期,他们每天处理超过 100 万份文档。在如此大的处理量下,即使病情检测的错误率仅为 1%,每天也会产生数千条错误记录,而每一条都可能带来患者安全风险或合规责任。
要实现这一目标,需要解决临床文档处理领域三个最棘手的挑战:以高召回率从患者记录中检测特殊疾病、可靠识别数十种表单类型中的 PDF 复选框,以及从单个页面内混合多种格式的文档中准确提取信息。
Guardoc Health 基于 Amazon Nova 模型系列和 Amazon Bedrock 构建了处理流水线,并结合多项 AWS 服务来处理文档处理的各个阶段。以下章节将介绍每个部分的工作原理。
Guardoc Health 使用检索增强生成(RAG)从患者记录中识别疾病。RAG 是一种技术:模型首先从外部来源检索相关信息,然后利用这些上下文生成更准确的响应。在这条流水线中,Guardoc 直接从患者自身的文档中检索证据,结合这些证据进行推理,并得出最终分类。
图 1——Guardoc 检索增强生成流水线
如上图所示,流水线按以下顺序运行:
传入的患者文档首先经过 Amazon Textract,由其从每个页面中提取文本和结构化元数据。这是流水线的第一阶段,能够以较低的单页成本进行全面提取。Amazon Textract 是一项 AWS 机器学习(ML)服务,可以自动从扫描文档和 PDF 中提取文本、手写内容、表单、表格及版面信息。它不仅能完成基本的光学字符识别(OCR),还能识别文档结构,因此其输出可以直接用于下游应用和文档工作流。
提取出的内容会根据文档类型,沿适当的边界划分为分块,使各个分块对应有意义的临床单元,而不是任意的字节范围。分块是文档中较小的片段,按照有意义的临床边界划分,例如用药清单、诊断章节或医生笔记,而不是根据字符数或字节大小任意切分。这样可以确保流水线在搜索相关信息时,检索到的是完整、连贯的临床单元,而不是缺乏准确分类所需上下文的零散片段。
使用 Amazon Titan Text Embeddings V2 对每个分块进行嵌入,并将其存储在 Amazon DynamoDB 中。数据按患者分区,确保检索不会跨越患者边界。
在开始检索之前,自定义预过滤器会根据文档类型、时效性和患者上下文信号缩小候选集合。此步骤会在流水线早期移除不相关文档,从而减少需要搜索的内容量,并降低检索的总体成本。
在经过预过滤的集合中,通过内存中的 k 近邻(k-NN)搜索,检索与疾病分类查询最相关的分块。k-NN 是一种通过测量向量表示之间的距离来识别最相似项目,并返回与查询最接近匹配项的技术。由于检索范围限定在单个患者内,系统可以随患者数量横向扩展,而无须依赖共享向量索引。此阶段仅返回页面引用,从而在进入后续计算量更大的多模态步骤之前,将数据传输保持在较轻量的水平。
上一步识别出的页面会经过 Amazon Nova 2 Lite。这是一种轻量、经济高效的模型,负责执行基于文本的审核,移除明显不匹配的内容,然后流水线才会进入计算开销更大的多模态步骤。Amazon Nova 2 Lite 是 Amazon Nova 系列中一种低成本的多模态基础模型(FM),专为快速、经济地处理文本、图像和视频输入而设计。
通过之前所有阶段的页面,会连同原始 PDF 字节一起传递给 Amazon Nova Pro。Nova 模型对版面、手写内容、签名、图章和其他视觉上下文进行推理,生成最终分类;每项输出都能追溯到其对应的具体来源页面。
该流水线遵循经过精心设计的成本分层原则。每个阶段都使用能够完成相应工作的成本最低的组件。Amazon Titan Text Embeddings 和 Amazon Nova 2 Lite 负责嵌入、索引和粗粒度过滤等高吞吐量、轻量级任务,而 Amazon Nova Pro 则保留用于最后阶段,因为该阶段需要对原始 PDF 字节进行多模态推理。
流水线生成的每项分类都可以追溯到原始文档中的具体来源页面。在临床环境中,每项决策都直接关系到患者安全,因此 Guardoc Health 将这种级别的可追溯性视为不可妥协的要求。
Guardoc 运行着多条文档处理流水线,每条流水线都专门用于解决提取、分类和搜索方面的特定临床挑战,具体如下文所述。
大多数医疗文档原生以 PDF 形式存在,无论是扫描生成、拍照生成,还是直接以数字形式创建。要准确处理这些文档,需要模型以视觉方式读取页面,而不是将其视为纯文本。在评估过程中,Amazon Nova Pro 在多模态 PDF 处理方面展现出显著提升,包括对版面、表单结构、复选框状态、签名、手写批注以及页面字段之间空间关系的理解。
这一改进使 Amazon Nova Pro 能够成为 Guardoc 流水线的核心多模态组件。疾病分类、手写内容识别和用药信息提取,都依赖于按照页面的实际呈现方式进行读取,并完整保留批注、修正内容和版面线索。这项能力在各种文档类型中均表现一致,包括复选框、手写内容、多栏用药清单、盖章证明和删除线修改;这些内容都会被视为视觉文档而不是文本流来读取,而这正是整个多模态技术栈得以实现的基础。
现实中的医疗文档包含大量手写内容。医生笔记、患者签名、批注字段以及对打印表单的修改,都可能以手写形式出现。Amazon Nova 模型系列能够准确处理这些内容,包括草写文本、临床速记,以及印刷内容与手写内容混合的页面。
对于 Guardoc Health 而言,这项能力在两类文档中最为关键。第一类是事先授权表单中的医生证明字段,其中手写备注可能会推翻印刷的复选框内容。第二类是患者自述症状部分,其中的手写内容通常包含病历其他位置未记录的信息。在 Guardoc Health 早期版本的处理管道中,遗漏这些文本是造成信息丢失的重要原因。
药物数据是患者病历中影响最为重大的内容之一。药物名称、剂量、给药途径和用药频率会直接用于临床决策,任何一项出现错误都可能危及患者安全。药物核对、事先授权和保险覆盖决策,都依赖于从文档中准确提取这些信息,而这些文档几乎从不会以整洁规范的形式呈现它们。
挑战在于形式多样。药物信息可能出现在结构化表格中、医生记录里的非结构化叙述中、印刷列表旁的手写补充中,也可能出现在经过多人反复传真或拍照的扫描页面中。同一份患者病历的不同页面可能包含所有这些格式。
Guardoc Health 运行了一套混合处理管道,将 Amazon Textract 与 Amazon Nova 系列模型结合使用:
Amazon Textract 执行 OCR,生成包含边界框、表格结构和表单字段识别结果的结构化输出。对于清晰的表格和印刷药物清单,Amazon Textract 速度快、成本效益高且准确。
Amazon Nova Pro 会同时接收原始 PDF 和 Amazon Textract 的输出;后者包含机器可读文本以及源页面的视觉布局信息。
Amazon Nova 模型通过解决复杂的提取场景来补充 Amazon Textract 的能力,包括跨换行表格列拆分的药物信息、印刷列表中的手写补充、非标准表格格式,以及隐藏在医生记录中的行内药物提及。
在这套处理管道中,每个组件都负责其最擅长的任务。Amazon Textract 处理大批量的结构化信息提取,而 Amazon Nova 系列模型则运用多模态推理来处理更复杂的情况。最终得到的药物数据可由下游临床工作流直接使用,无需人工核对。
文档记录错误会同时带来临床和财务后果。遗漏或不准确的记录可能导致理赔被拒、审计罚款、在 Patient-Driven Payment Model(PDPM,患者驱动支付模式)下损失报销款项,以及诉讼风险增加。PDPM 是一项面向专业护理机构的 Medicare 支付制度,其报销金额与临床文档记录的准确性直接相关。
Guardoc 部署所取得的结果体现了这一影响。在覆盖两家机构、200 名患者的一个季度部署中,Guardoc 推动完成了 847 项文档记录修正,解决了 86 项影响 PDPM 的问题,并与每 100 次入院对应的住院转诊数量减少 74% 相关。最后这项数据尤其重要,因为对于患者和机构运营而言,住院转诊都是长期护理中成本最高、干扰性最强的事件之一。
在另一项覆盖 7 家机构、服务 1,618 名居民的更大规模案例研究中,Guardoc 识别出了 10,612 个问题,并提高了机构层面风险模式的可见性。这种规模的问题检测非常重要,因为长期护理中的文档记录问题通常只有在引发理赔拒绝或监管审计时才会暴露,因此主动识别问题能够带来显著的运营优势。另一项季度分析报告称,文档记录错误平均减少了 46%;取得的成果包括单家机构每年获得超过 40 万美元的投资回报、审计罚款减少 70%,以及诉讼风险降低 65%。这些结果表明,提高文档记录准确性可以直接转化为机构可衡量的财务与合规成果。
长期护理中的临床文档记录是一项高风险难题,过去一直难以实现自动化。文档混乱、格式差异巨大,而错误所造成的后果横跨患者安全、监管合规和财务绩效等多个方面。Guardoc 证明,基于适当 AWS 服务组合构建且架构合理的处理管道,能够大规模解决这一问题。通过结合 Amazon Textract、Amazon Titan Text Embeddings V2、Amazon DynamoDB,以及可通过 Amazon Bedrock 使用的 Amazon Nova 系列模型,Guardoc 能够对医疗健康领域中一些最复杂的文档类型进行准确、可追溯且具备成本效益的处理。
“借助 Nova 系列模型,我们让医疗健康机构能够更轻松地提前发现高风险病例,并在问题产生高昂成本之前采取行动。通过将过去需要人工监督的工作流自动化,Nova 系列模型可以帮助团队减少合规缺口、防止错误,并将更多时间投入到改善患者治疗结果上。”
——Guardoc Health 产品总监 Assaf Amiaz
跨机构和患者群体取得的结果表明,改善文档记录不仅仅是一项运营优化,更是迈向更安全、更高质量护理的重要一步。
Guardoc 的路线图将从合规扩展到更广泛的临床工作流。计划推出的模块包括 AI NoteAssist、MDSAssist、CarePlanAssist、AdmissionAssist 和 Pharmacy Reconciliation,旨在帮助团队准确记录、减少人工工作量,并在电子健康记录(EHR)系统中高效完成完整的临床工作流。
Amazon Nova 2 系列模型扩展后的上下文窗口,使多文档推理变得更加可行,让处理管道能够在一次处理中跨更大规模的临床内容进行推理。多模态能力的持续改进正在逐步减少目前仍需人工审核的边缘情况,例如质量退化的扫描件、混合格式页面和非标准布局。底层系统的发展方向与 Guardoc Health 所解决问题的需求高度一致。
医疗文档处理是企业级 AI 风险最高的应用场景之一。文档的多样性极高、容错空间极小,而且失败会带来真实后果,具体表现为治疗延误、合规风险和不必要的成本。
对于正在评估使用 AI 处理临床文档的医疗健康机构,实用建议非常明确:使用自身的实际文档类型进行基准测试,分别衡量召回率和精确率,并根据每种错误类型的实际代价设置信心阈值。Amazon Nova 系列模型和 Amazon Bedrock 提供了相应的基础设施和灵活性,可用于构建不仅能在演示中运行,还能经受生产环境考验的处理管道。真正的工作在于根据具体工作流、文档类型,以及那些病历能否得到正确处理的患者的特定需求,对这套基础设施进行校准。
Guardoc Health 是一家由 AI 驱动的临床操作系统公司,帮助专业护理机构(SNF)和辅助生活机构(ALF)的长期护理团队改善文档记录并降低风险。网站:www.guardoc.health | 联系方式:info@guardoc.health
Amazon Nova 是 Amazon 推出的一系列基础模型,可通过 Amazon Bedrock 使用。Nova 模型支持文本、图像和文档输入,其能力针对文档处理、信息提取和多模态推理等企业工作负载进行了优化。Nova Pro 在复杂文档任务中提供领先性能,包括 PDF 处理、手写内容识别和结构化数据提取。开始使用 Amazon Bedrock。