基于提议-执行-反馈循环实现数据实验自动化,40次迭代后可产出可用结果,但需要Docker和GPU环境。
RD-Agent 是微软开源的框架,用 LLM Agent 实现 R&D 工作流自动化。我用它驱动 saas.pet 工具分析的数据实验,持续了一个月,以下是关于 propose-execute-feedback 循环的真实使用体验:它在哪类事情上实现了自动化,为什么它不是一键研究的魔法按钮。
RD-Agent 是我见过的最接近「真正能干活的研究助手」的东西,而不是只会聊天。它是微软的框架,用来自动化 R&D:你给它一个研究目标,它会提出方法、执行实验、读取结果、迭代改进。我用它做 saas.pet 的数据分析工作,比如探索工具数据库中的规律,或测试某个新的分类规则是否能提升搜索质量。propose-execute-feedback 循环是真实存在的:它曾一夜跑完 40 轮实验迭代,然后带回一个可以直接用的结果。说实话需要注意的地方:它面向数据科学和 ML 工作流设计,不是一般的软件开发,而且需要在定义良好的环境中运行实验。它也比较重量级,严肃运行建议用 Docker 和 GPU。对于需要反复做数据实验的人来说,它确实有用;对于一般编程任务,还是用编程 Agent 吧。
RD-Agent 是微软研究院开源的框架,用 LLM Agent 自动化研发工作流。它围绕 propose-execute-feedback 循环构建:Agent 提出假设或方法、在环境中执行、读取结果的反馈、并迭代改进。它面向数据科学和 ML 研究工作流,涵盖特征工程、模型选择、实验运行、报告生成等环节。截至 2026 年 8 月,该仓库有 14,326 颗星,MIT 许可证,虽然最新标记版本是 2025 年 11 月的 v0.8.0,但代码库有 2026 年 8 月的提交记录,说明仍在活跃开发中。该项目自称要解决的核心问题是:LLM 如何提升工业 R&D 效率,其设计也反映了这一点——这是一个严肃的研究工具,不是聊天机器人的包装。
saas.pet 维护着一个 AI 工具数据库,包含分类、评分和使用数据。我经常遇到一些重复性的问题:哪些分类特征能预测高参与度,新的标签规则能否提升搜索相关性,评论长度和评分之间有什么规律。以前每个问题都意味着要写脚本、运行、看输出、调整、再重复。RD-Agent 承诺正好自动化这个循环,于是我在 Docker 中搭建了它,用一份工具数据副本构建了一个小型实验环境。第一次运行是一个分类实验:我让它测试添加一个 domain 字段是否能提升搜索结果相关性,它提出了评估指标、运行了实验、测量了基线、尝试了变体,最后带回了一张对比表。第一天它不是完美研究助手,但循环是真的,输出是可用的。
核心机制是一个循环:propose、execute、feedback、iterate。在实践中,这意味着 RD-Agent 不是简单回答一个问题,而是运行真实的实验。在我的分类测试中,它提出了衡量相关性的指标、写好了评估脚本、对数据执行、读取结果、发现新字段对某些分类有帮助但对另一些有害,然后迭代改进方法。最令人印象深刻的一次运行是一个通宵实验:它执行了 40 轮特征选择任务的迭代,最后给我留了一份关于什么有效、什么无效的总结。反馈机制是它区别于直接问 LLM 的关键:Agent 看到的是真实执行结果,而不是猜测。它还会生成报告和跟踪实验记录,所以你能看到尝试过的历史。对于工作涉及反复数据实验的人来说,这个循环就是产品本身。
RD-Agent 最强的地方是结构化数据科学工作流:特征工程、模型评估、实验对比、报告生成。它包揽了研究中枯燥的部分——运行实验和总结结果,而且做得很好。它不是通用软件开发 Agent:它不会构建 Web 应用或修复生产 Bug,那是 Cline 或 OpenHands 这类编程 Agent 的活。它也不是领域专家的替代品,你仍然需要定义研究问题并验证结果。最佳使用场景是:你有一个会手动运行的数据实验,RD-Agent 替你跑并迭代,你去做别的事。预期管理也很重要:它需要定义良好的环境,Docker 是推荐路径,严肃的 ML 运行有 GPU 会更好。在纯 CPU 机器上,小实验可以跑,大模型训练不行。
与 OpenHands 和 Cline 这类编程 Agent 相比,RD-Agent 是不同类别:那些是为软件工程任务设计的,在代码库中写代码和修 Bug,而 RD-Agent 是为研究工作流设计的,提出和运行实验。用 RD-Agent 写一个 Web 功能会很别扭,用 Cline 跑一个 40 轮的特征选择研究同样别扭。和普通 Jupyter 笔记本对比,差异在于自动化:笔记本是手动循环——写、运行、读、调整,而 RD-Agent 自动关闭了这个循环。对于像我这样的独立操作者,时间节省来自循环无人值守地运行,尤其是通宵跑的那种。务实的结论是 RD-Agent 是技术栈中的一个工具,不是整个技术栈:它处理实验循环,软件工作仍然需要编程 Agent。
RD-Agent 采用 MIT 许可证,免费使用。搭建成本是真实存在的:它运行在 Docker 中,需要 Python 依赖,推荐路径还包括相当多的实验环境配置工作。我花了一个下午才完成第一次端到端运行,包括 Docker 搭建和让它指向数据。模型成本取决于你接入什么:它支持 OpenAI 兼容的 API,所以可以用 DeepSeek,成本很低,我的通宵 40 轮迭代运行花不到一美元。它也支持本地模型,如果你想让实验数据留在本地,这很重要。资源成本是更大的考量因素:严肃的 ML 实验需要 GPU,纯 CPU 运行仅限于小数据集和简单模型。对于数据规模的工作,要把计算成本和模型成本一起考虑。
坦诚的局限性。第一,它很专业:只面向数据科学和 ML 研究工作流,一般开发不在范围内。第二,环境搭建比较重:Docker、依赖、一个定义良好的实验空间,学习曲线比聊天机器人或笔记本陡峭。第三,发版节奏有点奇怪:最新 tag 是 2025 年 11 月的,但提交仍在继续,这会让版本锁定产生困惑。第四,结果取决于你的研究问题定义得是否清晰,垃圾问题产生垃圾实验。谁应该跳过 RD-Agent:工作属于软件开发而非数据实验的人,以及不愿意投入搭建工作的人。对于做重复实验的数据从业者,我给 4 分(满分 5 分),循环确实有用,通宵自动化是杀手级功能。它不会替代你的判断,但它会趁你睡觉时跑实验。
真正的 propose-execute-feedback 循环,不只是聊天
无人值守运行实验,通宵自动化有效
覆盖特征工程、模型选择、报告生成
MIT 许可证,微软支持,活跃开发中
OpenAI 兼容模型支持,用 DeepSeek 成本低
跟踪实验历史并生成报告
专为数据科学和 ML 设计,不是一般开发
搭建工作重:Docker、依赖、需要定义良好的环境
严肃 ML 运行建议配 GPU
最新 tag 较旧(v0.8.0,2025 年 11 月)但提交仍然活跃
结果取决于研究问题的定义质量
Originally published on https://saas.pet/reviews/rd-agent-review