Google 发布 MedGemma 多模态模型,专为医疗领域优化,支持文本和医学影像处理。
Daniel Golden,工程经理;Rory Pilgrim,产品经理,Google Research
我们正式发布 MedGemma 系列中的全新多模态模型。这是我们目前能力最强的健康 AI 开发开放模型。
MedGemma 技术报告
Hugging Face 上的 MedGemma
医疗健康行业正越来越多地采用 AI,以改善工作流管理、患者沟通以及诊断和治疗支持。至关重要的是,这些基于 AI 的系统不仅要具备出色的性能,还要兼顾效率与隐私保护。正是基于这些考量,我们构建并于近期发布了 Health AI Developer Foundations(HAI-DEF)。HAI-DEF 是一套轻量级开放模型,旨在为开发者开展健康领域研究和应用开发提供可靠的起点。由于 HAI-DEF 模型是开放的,开发者可以完全掌控隐私、基础设施以及对模型的修改。今年 5 月,我们通过 MedGemma 扩充了 HAI-DEF 系列。MedGemma 是一套基于 Gemma 3 的生成式模型,旨在加速医疗健康和生命科学领域的 AI 开发。
今天,我们很高兴地宣布该系列新增两款模型。第一款是 MedGemma 27B Multimodal。它在此前发布的 4B Multimodal 和 27B 纯文本模型基础上,新增了对复杂多模态数据以及纵向电子健康记录解读的支持。第二款新模型是 MedSigLIP,这是一款轻量级图像与文本编码器,适用于分类、搜索及相关任务。MedSigLIP 与 4B 和 27B MedGemma 模型采用了相同的图像编码器。
MedGemma 和 MedSigLIP 是开展医学研究和产品开发的有力起点。MedGemma 适用于需要生成自由文本的医学文本或影像任务,例如报告生成或视觉问答。对于分类或检索等涉及结构化输出的影像任务,我们推荐使用 MedSigLIP。上述所有模型都可以在单张 GPU 上运行,MedGemma 4B 和 MedSigLIP 甚至可以经过适配后在移动端硬件上运行。
关于 MedGemma 和 MedSigLIP 的开发与评估详情,请参阅 MedGemma 技术报告。
MedGemma 系列包含 4B 和 27B 两种规模的模型变体。目前,两者均可接收图像和文本输入,并生成文本输出。
**MedGemma 4B Multimodal:**MedGemma 4B 在 MedQA 上取得了 64.4% 的成绩,使其跻身表现最出色的超小型(<8B)开放模型之列。在一项非盲研究中,一位获得美国专业委员会认证的放射科医师认为,MedGemma 4B 生成的胸部 X 光报告中有 81% 具备足够的准确性,与放射科医师的原始报告相比,可以得出相似的患者管理方案。此外,它在医学图像分类任务上的表现也足以媲美针对特定任务构建的当前最先进模型。
**MedGemma 27B Text 和 MedGemma 27B Multimodal:**根据内部及已发表的评估结果,MedGemma 27B 模型在 MedQA 医学知识与推理基准测试中,属于表现最出色的小型开放模型(<50B)之列。其中,文本变体取得了 87.7% 的成绩,与领先的开放模型 DeepSeek R1 相差不到 3 个百分点,但推理成本仅约为后者的十分之一。在包括电子健康记录数据检索与解读在内的多项基准测试中,MedGemma 27B 模型都能与更大规模的模型相竞争。
在 MedQA 上,MedGemma 4B 和 27B 均位列各自规模模型中的最佳表现者之列。请注意,该图中的成本估算基于 legacy.lmarena.ai 的价格分析以及 together.ai/pricing。对于排行榜中未收录的模型,我们采用了其派生来源模型的价格数据。
根据一位获得美国专业委员会认证的心胸放射科医师的评审,我们发现,与放射科医师的原始报告相比,MedGemma 生成的胸部 X 光报告中有 81% 可以得出相似的患者管理方案。
在开发这些模型时,我们首先训练了一个针对医学领域优化的图像编码器——该编码器也以 MedSigLIP 的名称独立发布,详见下文——随后使用医学数据训练相应的 4B 和 27B 版本 Gemma 3 模型。在整个过程中,我们特别注意保留 Gemma 的通用(非医学)能力。因此,MedGemma 能够在混合医学与非医学信息的任务中取得良好表现,同时保留指令遵循能力以及非英语语言能力。
这些模型的一项关键特性是适应性。例如,经过 fine-tuning 后,MedGemma 4B 能够在胸部 X 光报告生成任务上达到当前最先进水平,RadGraph F1 得分为 30.3。开发者可以通过直接、简便的方式提高模型在目标应用中的表现,这凸显了 MedGemma 的价值:对于希望构建医疗健康 AI 的开发者而言,它是一个优秀的起点。
MedSigLIP 是一款仅包含 400M 参数的轻量级图像编码器,采用 Sigmoid Loss for Language Image Pre-training(SigLIP)架构。MedSigLIP 由 SigLIP 经过调优而来,调优所使用的多样化医学影像数据包括胸部 X 光片、组织病理学图像块、皮肤科图像和眼底图像,使模型能够学习这些模态特有的细微特征。重要的是,我们也特别确保 MedSigLIP 在原始 SigLIP 模型训练所使用的自然图像上仍能保持出色表现,从而延续其通用性。
MedSigLIP 旨在通过将医学图像和医学文本编码到同一个 embedding 空间中,弥合两者之间的差距。与针对特定任务构建的视觉 embedding 模型相比,MedSigLIP 的分类性能与之相当或更优,同时在不同医学影像领域具有高得多的通用性。
MedSigLIP 非常适合:
**传统图像分类:**构建高性能模型,对医学图像进行分类。
**Zero-shot 图像分类:**无需特定训练样本,通过比较图像 embedding 与文本类别标签的 embedding 对图像进行分类。
**语义图像检索:**从大型医学图像数据库中查找视觉上或语义上相似的图像。
由于 MedGemma 系列是开放的,开发者可以下载这些模型、在其基础上继续构建,并通过 fine-tuning 满足自己的具体需求。尤其是在医疗领域,与基于 API 的模型相比,这种开放方式具有多项显著优势:
**灵活性与隐私:**模型可以在专有硬件上运行,并部署到开发者首选的环境中,包括 Google Cloud Platform 或本地环境,从而满足隐私要求或机构政策。
**通过定制获得高性能:**可以对模型进行 fine-tuning 和修改,使其在目标任务与数据集上达到最佳性能。
**可复现性与稳定性:**由于模型以快照形式分发,其参数是固定的;与 API 不同,模型不会随着时间推移而发生意外变化。对于一致性和可复现性至关重要的医疗应用而言,这种稳定性尤其关键。
为了确保广泛的可访问性和易用性,我们的 Hugging Face 系列以广受欢迎的 Hugging Face safetensors 格式提供 MedSigLIP 和 MedGemma。
研究人员和开发者一直在针对各自的使用场景探索 MedGemma 模型,并发现这些模型善于解决一些关键问题。美国马萨诸塞州 DeepHealth 的开发者一直在探索如何利用 MedSigLIP 改善胸部 X 光检查的分诊和结节检测。中国台湾长庚纪念医院的研究人员指出,MedGemma 能够很好地处理繁体中文医学文献,并且可以妥善回答医务人员的问题。印度古尔冈 Tap Health 的开发者则称赞了 MedGemma 卓越的医学知识基础,指出它在需要敏锐理解临床语境的任务中表现可靠,例如总结病程记录,或提出符合临床指南的提示建议。
随着开发者使用 MedGemma 和 MedSigLIP 打造下一代健康 AI 工具,我们期待继续了解这些使用场景以及更多新的应用。
为帮助开发者快速上手,我们在 GitHub 上为 MedGemma 和 MedSigLIP 提供了详细的 notebook,演示如何创建 MedSigLIP 和 MedGemma 实例,并在 Hugging Face 上进行推理和 fine-tuning。当开发者准备扩展应用规模时,可以将 MedGemma 和 MedSigLIP 无缝部署到 Vertex AI,作为专用 endpoint 使用;我们还在 GitHub 上提供了如何通过这些 endpoint 运行推理的示例。此外,我们还在 HAI-DEF Hugging Face 演示集中加入了一个新 demo,展示如何将 MedGemma 集成到应用中,以简化患者就诊前的信息收集工作。
该 demo 展示了如何将 MedGemma 集成到应用中,以简化患者就诊前的信息收集工作。demo 的代码可在其 Hugging Face 网站上获取。
请参阅下表,了解 MedGemma 系列中的哪款模型最适合你的使用场景。
* 对于不需要语言对齐的病理学专用应用,Path Foundation 可以为数据高效的分类任务提供高性能,同时需要的计算资源更少。
** Fast Healthcare Interoperability Resources(FHIR)记录基于文本,但拥有独特的结构。只有 MedGemma 27B Multimodal 模型的训练数据中包含了电子健康记录数据。
请访问 HAI-DEF 网站获取这些资源,并进一步了解 MedGemma 系列及其他 Health AI Developer Foundations 模型。如有问题或反馈,可前往 HAI-DEF 论坛。
模型使用公共数据集与私有的去标识化数据集混合训练。Google 及其合作伙伴所使用的数据集均经过严格的匿名化或去标识化处理,以确保研究参与者和患者的个人隐私得到保护。
MedGemma 和 MedSigLIP 旨在作为一个起点,帮助开发者高效开发涉及医学文本和图像的下游医疗健康应用。开发者不应在未针对具体使用场景进行适当验证、适配和/或实质性修改的情况下使用 MedGemma 和 MedSigLIP。这些模型生成的输出不得用于直接指导临床诊断、患者管理决策、治疗建议或其他任何直接的临床实践应用。性能基准测试展示了模型在相关基准上的基础能力,但即使面对占训练数据相当大比例的图像和文本领域,模型仍可能产生不准确的输出。所有模型输出都应被视为初步结果,需要经过独立验证、临床关联分析,并通过成熟的研究与开发方法进行进一步调查。
MedGemma 是 Google Research 与 Google DeepMind 合作的成果。我们感谢众多参与者为这项工作作出的贡献,其中包括 Google Health AI 和 Gemma 团队的工程成员与跨职能成员,以及来自 Google Research 和 Google DeepMind 的项目支持者。
MedGemma 技术报告
Hugging Face 上的 MedGemma