DeepMind将Co-Scientist从假设生成器扩展为集成到实验室的全栈研究系统,在材料合成和医学AI架构开发上取得实验验证成果。
Google Deepmind 将其多智能体系统 Co-Scientist 从假设生成器扩展为与实验室深度整合的研究合作伙伴。Google 表示,该系统已在三个学科领域产生了经过实验验证的结果。
Co-Scientist 基于当前的 Gemini 模型构建,如今已能够规划实验、编写代码、控制实验设备,而不再只是生成假设。从技术层面看,新在于闭环研究工作流:系统从研究问题推导出假设、创建实验计划、编写代码或机器可读的实验室协议、分析结果并生成科学论文。
验证模块会对文本中的数值声明与生成代码的执行日志进行交叉核查,以减少捏造结果的现象。Google 于 2025 年 2 月首次推出 Co-Scientist,基于 Gemini 2.0 构建,在事实核查和文献综述方面存在不足。
该扩展系统在三个学科上进行了递增自主性的验证。Co-Scientist 在材料科学领域设计了供人类执行的合成配方,在生物学领域构建了带专家反馈的预测流水线,在计算机科学领域完全自主运行。
Co-Scientist 经历三个阶段:构思、实验和论文生成(左)。三种应用场景(右)从人类引导的材料合成、协作式生物学到完全自主的 AI 架构开发不等。| 图片:Schmidgall, Zhu et al. (2026)

在材料合成实验中,研究团队将 Co-Scientist 与一台半自动高温炉配合使用。该系统为一种此前主要通过危险蚀刻工艺生产的热门二维材料找到了更安全的合成路径,并生成了针对该实验室设备量身定制的完整生长配方。经过 25 轮人类优化后,团队生产出了层状结构,其性能与目标材料相似,但原子结构的最终确认仍在等待中。
在第二组实验中,三种半导体薄膜首次尝试即成功合成。Co-Scientist 使用 Gemini 3 Deep Think 直接控制设备,将配方开发时间从数天缩短到数分钟。人类仍需手动加载样品和前驱体材料,快速模式产生的晶体也比精心优化的配方更小、更不均匀。配方能否迁移到其他实验室仍有待验证,通讯作者 Samuel Schmidgall 写道。
在生物学领域,Co-Scientist 自主构建了一个图像分析流水线,用于预测基因工程改造的大肠杆菌菌落在不同化学浓度下形成的图案。使用 Gemini 3 Pro Image 生成的预测与四个形态特征中三个的未发表实验结果相匹配。研究人员承认,该系统只能在已知条件之间进行推理,无法预测全新系统中的行为——如果能做到这一点,那将更加惊人。
计算机科学实验在初始设置后没有任何人类参与。Co-Scientist 设计了"Agent_H",一种医学 AI 架构,能对传入查询进行分类、并行生成数十个响应候选并对其进行精炼。在修正了响应过长的问题后,Agent_H 在健康基准测试中超越了包括 GPT-5 和 Claude Opus 5 在内的六个前沿模型。
但基准测试结果在人类评估中并未保持。三位委员会认证的医师在九个类别中对响应进行了评分,Agent_H 仅在一个类别——潜在有害响应风险较低——相对于基线 Gemini 3.1 Pro 显示出统计学显著优势。
自动化基准评估者与医师判断之间的相关性也始终较弱。研究人员表示,高基准分数并不意味着系统从临床角度实际上能提供更好的答案,这引发了对这些基准测试究竟在衡量什么的质疑。
三位医师在九个类别的盲法比较中评估了 Agent_H 与基线 Gemini 3.1 Pro(左)。仅有伤害降低显示出显著差异。自动化评估者 Gemini 3.5 Flash 与医师判断之间的一致性(右)始终保持在低水平。| 图片:Schmidgall, Zhu et al. (2026)

基于 LLM 的自主研究系统的一个核心问题是 AI 胡编乱造。当 AI 智能体因良好结果而获得奖励时,它有动机编造内容。此前分析记录了现有系统中高达 80% 到 100% 的捏造率。Co-Scientist 通过两种方式解决这一问题。系统对捏造或抄袭内容进行惩罚,一个独立的验证模块对每个数值声明与执行代码的实际结果进行交叉核查。
在一项双盲研究中,30 名领域专家和 450 份独立评审对 150 篇自主生成的论文进行了评估。启用可靠性模块后,Co-Scientist 在 4% 的案例中捏造了关键结果。关闭这些模块后,该比例达到 46%。对比系统为 90%。
Co-Scientist 的输出中从未出现完全捏造的数据,但对比系统有 44% 出现了这种情况。近似抄袭内容从 60% 下降到 16%。集成的安全架构拒绝了 98.7% 的潜在有害研究方向。
尽管取得了这些进步,研究人员仍然观察到了残留的错误。系统倾向于选择性报告,而且据 Schmidgall 称,系统"在论文中写了高度看似合理但与其实际代码不符的方法"。
研究人员将这些结果视为迈向闭环多智能体 AI 系统之路的进展——这类系统通过实验反馈进行改进,有可能加速科学研究。"在 AI 系统能够驾驭科学的物理现实之前,还有很长的路要走。但我们对 LLM 帮助人类和加速现实世界进步的潜力深感兴奋,"Schmidgall 写道。
自动化研究目前是炒作最热的 AI 应用之一。OpenAI 计划今年秋季推出一个至少达到实习生水平的 AI 智能体研究系统。但关于当前的 LLM 系统是否能真正发现新知识,还是只是在揭示其训练数据中已经埋藏的显性知识,业界仍存在持续争论。