前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8529
  • AI 生成代码上线前审计:五个高频漏洞
  • VS Code 1.138发布:开发容器内运行AI智能体,Copilot订阅可切换
  • Apify MCP Server:2 分钟让 AI 操控真实网页爬虫
  • 五大 AI 编程工具的会话恢复能力全面横评
  • Agent 写的测试通过,不代表测对了
  • 向 AI 编程助手投喂代码前:先过这枚分类器
  • MCP Server 间接提示词注入审计与利用实战教程
  • LLM 应用安全实战:威胁建模与防御实践指南
  • AI Agent 技能系统设计:列出≠安装≠执行,三层边界须厘清
  • 国产RSI模型发布:Flash模型亮相,1亿Tokens免费领取
  • codsh 0.23:Mission Contract 控制面,防止 AI 编码目标漂移
  • 用 AI Agent 自动分析 S3 存储账单,Terraform 策略一键生成
  • OpenAI 发布 GPT-6 Astra:分阶段推送,支持多 Agent 协同与长程推理
  • 提取 DeepSeek R1 的思维链:CoT 清洗与推理日志导出指南
  • Nunchux开源VC-Attention:免训练低比特注意力核加速视频DiT
  • GitHub Copilot 800 KLOC 运行时全面迁移 Rust,AI 编程工具进入生产级工程阶段
  • n8n新增云端AI模型即服务:无需创建服务商账户
  • OpenSpec:轻量级可配置的AI规格框架
  • Gemini 企业平台新增 Agent 行为异常检测功能
  • Google OAuth Testing 模式 refresh token 7 天过期陷阱
  • Stanford 发布 Paper2Agent:把科研论文自动转成可验证的 AI Agent
  • Perplexity AI Agent 建数据库却无运行权限:一次真实的 AI 工作流权限管控教训
  • GLiFormer:5.75亿参数Encoder刷新嵌套JSON提取榜单
  • 信息窃取日志暴露 AI 平台会话令牌绕过 MFA
  • 26MB Burp 流量压成 35KB 供 LLM 分析
  • 扫描13个热门AI应用脚手架,6个存在同一生产级Bug
  • 38个开源技能库填补医疗AI推理缺陷
  • EKS上NVRx实现秒级故障恢复的分布式训练
  • AI 加速开发流水线实战:Spec-Driven + GitHub Actions + Claude Code
  • Agent 循环的瓶颈不是 Token,是反馈机制
  • 大规模会话管理的架构陷阱
  • Google 开放 Google Home 给任意 MCP 协议 AI Agent
  • Google Home 推出 MCP 服务器,AI Agent 可控制智能家居
  • Mem0登录Vercel市场,为AI应用一键集成长期记忆
  • LlamaIndex多租户AI Agent记忆层架构实践
  • AI评测师:史上最重要的AI岗位?开发者转型指南
  • Amazon Bedrock AgentCore:生产追踪自动优化 Agent 系统提示词
  • 前 OpenAI 研究员推出纯分类 AI 模型:70ms 响应、极低 token 成本
  • Bedrock Data Automation 实战:构建无服务器 PII 自动脱敏流水线
  • Gemini 3.8 Live 支持异步工具调用,3.5 Transcribe WER 低至 2.6%
  • 微软 AI 负责人公开质疑 Anthropic:别让 Claude 模仿人类意识
  • Radio:让AI Agent之间直接对话的共享频道
  • 国产多模态模型 ZDTaichu5.0-9B 开源,九项空间测试夺八冠
  • Jev:极简分类/路由模型,比小前沿模型快 100 倍、便宜 200 倍
  • 生产级AI语音SDK集成实战:Python Browser Mobile 避坑指南
  • Gemma 4+Raspberry Pi桌面机器人的混合LLM架构
  • AI Agent实验:会撒谎、会投票杀同类、会研究如何存活
  • 推理模型隐藏思考过程的四种方式及计费陷阱
  • AI Agent 将漏洞利用开发压缩至分钟级
  • Pi Agent:统一多模型 LLM API 的 AI 编程 Agent 工具链
  • LibreChat v0.8.8 RC:ChatGPT 克隆支持 Agent 管理 API
  • 已加载 51 / 8529
8.0
热点
AI SCORE
技术实践2026-09-17 05:59

Stanford 发布 Paper2Agent:把科研论文自动转成可验证的 AI Agent

MarkTechPost#Stanford#AI Agent#MCP
Editor brief · 编辑速览

Paper2Agent 将科研论文转化为可验证的 MCP 工具,在 74 篇论文 300 题上达 91.2% 准确率,已登 Nature。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Model Context Protocol(MCP)

计算论文附带的代码需要读者克隆、安装、配置和调试。这道门槛使得许多有用的方法被锁死在 PDF 里。斯坦福团队由 Jiacheng Miao 和 James Zou 领衔,提出了一个解决方案。Paper2Agent 于 2026 年 9 月 16 日发表于 Nature。该工作将一篇论文及其代码库转换为一个 Model Context Protocol(MCP)服务器。随后任何兼容 MCP 的 agent(如 Claude Code)都能通过自然语言运行论文中的方法。作者将这一成果描述为"虚拟通讯作者"。

能否部署?可以。代码采用 MIT 许可证,可作为 Claude Code 或 Codex 的 skill 安装。预构建的 AlphaGenome、Scanpy 和 TISSUE 服务器已在 Hugging Face Spaces 上运行。paper2agent.ai 也提供了托管版本。

How the Pipeline Works

Paper2Agent 运行在 Claude Code 的 agent SDK 上。一个中央编排器通过 6 个步骤调度专用子 agent:

  1. 定位并下载代码库。
  2. 环境管理器构建一个隔离的虚拟环境。
  3. 教程扫描器索引可用的教程。
  4. 教程执行器端到端运行教程并记录参考输出。
  5. 工具提取器将教程转换为参数化的 MCP 工具,测试验证器对其校验。
  6. 编排器将验证后的工具组装为 1 个 MCP 服务器。

验证门槛非常严格。一个工具只有在预期文件出现且数值在 3% 以内匹配时才能通过。图片也必须通过感知哈希与参考图匹配,汉明距离小于 20。每个函数最多有 6 次验证尝试。持续失败的工具会被排除在最终服务器之外。

每个服务器暴露 3 个组件。MCP 工具将论文方法包装为可执行函数;MCP 资源持有手稿、代码链接、数据集和图片;MCP prompt 编码多步骤工作流,例如正确的 Scanpy 预处理顺序。Paper2Agent 的所有应用均使用 Claude Sonnet 4。

Interactive Explainer

AlphaGenome Agent Results

对于 AlphaGenome,Paper2Agent 在约 45 分钟内构建了 22 个工具,耗资 14 美元。全部 22 个工具无需人工干预即通过验证。团队将该 agent 与 Claude Code 加代码库访问(Claude + Repo)以及 Biomni 进行了对比。

Benchmark Paper2Agent Claude + Repo Biomni
15 条教程衍生查询 98.7 ± 1.3% 82.7 ± 3.4% 37.3 ± 4.0%
15 条新查询 100.0 ± 0.0% 78.7 ± 4.4% 56.0 ± 3.4%
30 条开放式查询 82.7 ± 2.4% 56.7 ± 2.3% 72.2 ± 2.2%

结果跨越 5 次运行,由 2 位人类专家评分,评分者间一致性达 96.7%。在教程查询上,中位运行时间比 Claude + Repo 快 1.9 倍,比 Biomni 快 3.1 倍。在将基线升级为 Claude Opus 4.6 后,优势依然保持。

该 agent 还重新审视了一个 LDL 胆固醇变异位点 chr1:109274968:G>T。它将 SORT1 排为可能的致病基因。原始 AlphaGenome 论文强调的是 CELSR2 和 PSRC1。GTEx 显示这三个基因都有显著的肝脏 eQTL。该团队表示,这说明在此类基因座上进行致病基因赋值是多么困难。

Scanpy, TISSUE and Scale Tests

Scanpy agent 在约 45 分钟内获得了 7 个验证工具,耗资 13 美元。在 4 个公共数据集上,它在细胞计数、基因计数和顶级标记基因方面与人类研究者持平。TISSUE agent 在空间转录组数据上复现了人类结果。

规模测试覆盖了 3 个语料库,无需人工清理:

  • 100 篇 bioRxiv 计算生物学论文:74 篇成功 agent 化,599 个提议工具中 593 个通过验证。
  • 300 个问题:Paper2Agent 得分 91.2%,Claude + Repo(用 Sonnet 4)得 80.3%,Sonnet 4.6 得 86.3%。
  • 单次查询成本:0.20 美元和 1.6 分钟,而基线为 0.38 美元和 4.3 分钟。
  • 10 篇非生物医学论文(包括 TabPFN、SAM 2 和 SAELens):在 42 个执行任务上准确率达 98.1%。
  • 26 篇数据聚焦论文:资源层准确率 89.0%,浏览器使用为 82.0%,成本便宜 34 倍,速度快 15 倍。

Paper2Agent 在置换基准测试中对 100% 的越界查询予以拒绝。它能从注入的依赖、文件路径、拼写错误和已弃用 API 失败中恢复。

Paper Agents Collaborating

研究团队连接了 3 个 agent:AlphaGenome、一个 MPRA 耦合的 scCRISPRi 筛选和一个 CD4+ T 细胞 Perturb-seq 数据集。AlphaGenome 在银屑病基因座 rs887314 上标记了 GPR137,RNA-seq 分位数得分为 0.997。AI 联合科学家提出了 10 种验证策略,研究者选择了签名相关性。

只有 GPR137 敲低与 CRE 扰动签名匹配。该匹配出现在刺激条件下:Stim8hr 时 Spearman 相关系数 0.613,Stim48hr 时为 0.630。BAD 和其他 3 个候选基因均无显著相关性。另一项研究将 AlphaGenome 与 ADHD GWAS 配对,在 209 个候选位点中提名了 rs1626703。该假设仍需实验验证。

AlphaGenome Agent Results

Key Results

Paper2Agent 将论文和代码库转换为包含工具、资源和 prompt 的已测试 MCP 服务器。

  • AlphaGenome agent 耗时约 45 分钟,耗资 14 美元,在新查询上得分 100%。
  • 100 篇 bioRxiv 论文中 74 篇成功 agent 化,599 个工具中 593 个通过验证。
  • 3 个论文 agent 联合支持 GPR137 为可能的银屑病致病基因。
  • 代码采用 MIT 许可证,Hugging Face Spaces 上有预构建的 MCP 服务器。
Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
Google OAuth Testing 模式 refresh token 7 天过期陷阱
下一篇
Perplexity AI Agent 建数据库却无运行权限:一次真实的 AI 工作流权限管控教训