医疗机构分享用反向 RAG 技术降低 AI 模型幻觉的实战经验,为构建高准确度 AI 系统的程序员提供可复用思路。
尽管大语言模型(LLM)变得越来越精巧和强大,但它们仍然持续受到幻觉的困扰:提供不准确的信息,或者更直白地说,撒谎。
这在医疗等领域尤为有害,因为错误的信息可能导致严重后果。
美国顶级医院之一的Mayo Clinic采用了一种新颖的技术来应对这一挑战。为了成功,这家医疗机构必须克服检索增强生成(RAG)的局限性。RAG是大语言模型从特定的相关数据源中提取信息的过程。该医院采用了本质上是反向RAG的方法,即模型提取相关信息,然后将每个数据点链接回其原始源内容。
值得注意的是,这几乎消除了非诊断用例中的所有基于数据检索的幻觉,使Mayo能够在其临床实践中推广使用该模型。
"通过链接引用源信息的这种方法,数据提取不再是问题,"Mayo的战略医学主任兼放射科主任Matthew Callstrom告诉VentureBeat。
处理医疗数据是一项复杂的挑战,而且可能很费时。尽管电子健康记录(EHR)中收集了大量数据,但这些数据可能极难找到和解析。
Mayo使用AI处理所有这些数据的第一个用例是出院小结(包括出院后护理建议的访问总结),其模型使用传统RAG。正如Callstrom解释的那样,这是一个很自然的起点,因为这是简单的提取和总结,而这正是LLM通常擅长的。
"在第一阶段,我们不是试图提出诊断,在那种情况下,你可能会问模型'这个患者现在最好的下一步是什么?',"他说。
幻觉的危险在这里也不如在医生辅助场景中那么显著;这并不是说数据检索错误不令人困惑。
"在我们最初的几次迭代中,我们遇到了一些明显无法接受的有趣幻觉——例如,患者的年龄错误,"Callstrom说。"所以你必须谨慎地构建它。"
虽然RAG一直是完善LLM事实基础(改进其能力)的关键组件,但该技术也有其局限性。模型可能检索到不相关、不准确或低质量的数据;无法确定信息是否与人类的询问相关;或创建与请求格式不匹配的输出(例如返回简单文本而不是详细表格)。
虽然有一些解决方法——例如图RAG,它利用知识图谱提供上下文,或纠正RAG(CRAG),其中评估机制评估检索文档的质量——但幻觉并未消失。
这就是反向RAG过程的作用。具体来说,Mayo将被称为使用代表聚类(CURE)的算法与LLM和向量数据库配对,以双重检查数据检索。
聚类对机器学习(ML)至关重要,因为它根据相似性或模式组织、分类和分组数据点。这本质上帮助模型"理解"数据。CURE通过分层技术超越了典型的聚类,使用距离度量根据接近度对数据进行分组(想象:彼此更接近的数据比距离更远的数据更相关)。该算法能够检测"异常值"或与其他数据点不匹配的数据点。
结合CURE和反向RAG方法,Mayo的LLM将其生成的总结拆分为单个事实,然后将这些事实匹配回源文档。第二个LLM随后评分事实与这些源的匹配程度,特别是两者之间是否存在因果关系。
"任何数据点都被引用回原始实验室源数据或成像报告,"Callstrom说。"该系统确保引用是真实的并被准确检索,有效地解决了大多数与检索相关的幻觉。"
Callstrom的团队使用向量数据库首先摄取患者记录,以便模型可以快速检索信息。他们最初为概念验证(POC)使用了本地数据库;生产版本是一个通用数据库,其逻辑在CURE算法本身中。
"医生非常怀疑,他们想确保自己没有被喂给不可信的信息,"Callstrom解释道。"所以对我们来说,信任意味着验证任何可能被呈现为内容的东西。"
CURE技术也证明对合成新患者记录很有用。Callstrom解释说,详细说明患者复杂问题的外部记录可能包含大量不同格式的数据内容。这些需要被审查和总结,以便临床医生在第一次见到患者前可以了解情况。
"我总是把外部医疗记录描述为有点像电子表格:你不知道每个单元格中是什么,你必须查看每一个才能提取内容,"他说。
但现在,LLM进行提取,对材料进行分类并创建患者概述。Callstrom表示,通常这项任务可能需要从医生的一天中占用大约90分钟,但AI可以在大约10分钟内完成。
他描述了在Mayo实践中扩展该能力以帮助减少行政负担和挫折的"极大兴趣"。
"我们的目标是简化内容的处理——我如何增强医生的能力并简化医生的工作?"他说。
当然,Callstrom和他的团队看到AI在更高级领域的巨大潜力。例如,他们与Cerebras Systems合作构建了一个基因组模型,可以预测什么是对患者最好的关节炎治疗方法,也在与Microsoft合作开发图像编码器和成像基础模型。
他们与Microsoft的第一个成像项目是胸部X光。到目前为止,他们已转换了150万张X光片,计划在下一轮中再转换1100万张。Callstrom解释说,构建图像编码器并不是特别困难;复杂之处在于使生成的图像实际有用。
理想情况下,目标是简化Mayo医生审查胸部X光的方式并增强其分析。例如,AI可能会识别他们应该在哪里插入气管导管或中心线以帮助患者呼吸。"但这可以更加广泛,"Callstrom说。例如,医生可以从胸部X光解锁其他内容和数据,例如射血分数的简单预测——或从心脏泵出的血液量。
"现在你可以开始在更广泛的范围内思考对治疗的预测反应,"他说。
Mayo也看到了基因组学(DNA研究)以及其他"组学"领域(如蛋白质组学——蛋白质研究)的"极大机会"。AI可以支持基因转录或复制DNA序列的过程,为其他患者创建参考点,并帮助为复杂疾病建立风险概况或治疗路径。
"所以你基本上是在将患者与其他患者进行比较,围绕一个队列构建每个患者,"Callstrom解释道。"这就是个性化医学真正提供的:'你看起来像这些其他患者,这是我们应该治疗你的方式以看到预期的结果。'目标是真正在使用这些工具时为医疗保健带回人性。"
但Callstrom强调,诊断方面的一切都需要更多的工作。证明基因组学的基础模型对风湿性关节炎有效是一回事,但在临床环境中实际验证是另一回事。研究人员必须从测试小数据集开始,然后逐步扩展测试组并与常规或标准治疗进行比较。
"你不会立即做出'嘿,让我们跳过甲氨蝶呤'[一种受欢迎的风湿性关节炎药物]的决定,"他指出。
最后:"我们认识到这些[模型]有能力真正改变我们以有意义的方式护理和诊断患者的方式,拥有更多以患者为中心或特定患者的护理而不是标准治疗,"Callstrom说。"我们处理的患者护理中的复杂数据是我们关注的地方。"