Microsoft Research发布的agent框架,提供统一基础设施供研究团队训练和评估各类agent。支持模型复用、降低开发复杂度。

Orchard 是一个用于可扩展且经济高效的 Agent AI 研究的开源框架,其核心是 Orchard Env,一个可复用的环境服务,用于跨任务领域的 Agent 训练和评估。
Orchard 的基础设施支持软件工程、网页导航和个人助手 Agent,并且可以直接在 Codex、OpenClaw 和 ZeroClaw 等实际部署环境中训练它们——让研究人员能够跨任务复用环境、数据流水线和评估工作流。
Orchard-SWE、Orchard-GUI 和 Orchard-Claw 表明相对较小的开源模型可以在复杂的现实任务上取得很强的结果。例如,Orchard-SWE 在 SWE-bench Verified 上达到 69.7%——加上 value model 重排后为 73.0%——仅使用约 30 亿个活跃参数,接近使用大 10 倍以上模型的前沿系统。
除了模型和工作流,该项目还发布了训练数据和评估方法,旨在帮助更广泛的研究社区构建和研究开源 Agent 系统。人工智能正在迅速超越静态问答,朝向能够在复杂多步环境中规划、推理和行动的自主 Agent 发展。这些系统可以修复复杂代码库中的 bug、代表用户浏览网页,以及管理涉及日历和电子邮件的工作流。
虽然人们对 Agent AI 的能力充满期待,但研究社区面临一个持久的瓶颈。构建最先进的 Agent 系统往往需要专有基础设施,包括定制沙箱、闭源训练流水线和专有数据集,大多数研究人员和从业者无法访问或复现。
为了解决这个问题,我们推出 Orchard,这是一个用于可扩展 Agent 建模的开源框架。Orchard 的核心是 Orchard Env,一个轻量级的 Kubernetes 环境,提供可复用的隔离组件,用于大规模运行和构建 Agent——从收集训练数据到强化学习推演和评估。
与许多现有框架不同,Orchard Env 被设计为支持不同的 Agent 系统和任务类型而无需修改。同一个服务可以支持软件工程 Agent、网页浏览 Agent 和跨域的个人助手 Agent。
为了演示这种方法,我们发布了三个特定领域的训练方案——Orchard-SWE、Orchard-GUI 和 Orchard-Claw。我们还发布了用于构建它们的训练数据和评估方法。
Orchard 背后的核心思想是,运行时环境应该是一个独立的、可复用的服务,而不是嵌入在特定训练框架内的基础设施。Orchard Env 的 Kubernetes 基础使其能够并行创建、管理和移除数千个隔离的组件。
该系统被设计为跨代码编写、网页浏览、工具使用等任务工作。它也被设计为跨不同的 Agent 系统工作,以及训练和评估过程的各个阶段,包括数据蒸馏和强化学习推演。
这种灵活性使 Orchard 在研究规模上具有实用性。团队可以引入新的基准、Agent 系统或训练算法,而无需从头重建底层基础设施。
Orchard 还使训练 Agent 在任何环境中成为可能。当今最强大的 Agent 很少作为单纯的模型运行。它们通过复杂的环境(如 Claude Code、Codex 和 OpenClaw)运行,这些环境管理多轮推理、工具使用和与外部系统的连接。开放训练工具通常无法处理这些有状态的、多进程的环境,迫使研究人员在简化的替代品上训练,然后在真实环境中部署,这会产生不匹配。Orchard 解决了这个差距:一个轻量级代理记录环境本身的模型调用作为训练数据,同时每个推演都在自己的容器中运行,所以一个 Agent 可以端到端地直接在它将被部署的环境中进行训练——OpenClaw、Codex、ZeroClaw 或其他——以及跨多个环境。
软件工程是自主 Agent 最具挑战性的设置之一。它需要在真实代码库上进行多步骤推理、工具使用,以及从错误中恢复的能力。Orchard-SWE 是我们针对这个领域的训练工作流。它采用 Mini-SWE-Agent 框架构建,旨在自主解决软件工程任务,并在广泛使用的 SWE-bench Verified 基准上评估,该基准测试模型的能力来导航、诊断和修复真实代码库。
为了训练该系统,我们从两个先进的开源权重模型(MiniMax-M2.5 和 Qwen3.5-397B)中蒸馏了 107,000 个 Agent 交互,涵盖广泛的 GitHub Issue。训练过程使用信用分配监督微调:与其丢弃 Agent 未能完全解决 Issue 的尝试,系统从这些部分尝试的有效部分学习,扩展可用于模型的有用训练数据的数量。
强化学习随之而来,但其反馈稀疏——Agent 通常只学习其最终补丁是否通过了隐藏测试。我们从平衡自适应推演开始,旨在充分利用这些不频繁的成功信号,然后添加两种"密集奖励"技术以获得更丰富的指导:策略上的蒸馏,其中更强的教师模型逐步为 Agent 的决策打分,以及过程奖励模型,其中一个 AI 评委奖励合理的问题解决过程——编写重现 bug 的测试、验证修复、检查现有行为仍然有效——独立于最终测试是否通过。
最后,我们在过去的推演上训练一个 value model 来重排候选方案。强化学习生成许多通常被丢弃的练习轨迹;相反,来自 20 个先前实验的轨迹训练一个紧凑的 40 亿参数 value model,该模型识别高质量的解决方案,在问题解决时对几个候选答案打分并选择最佳的。这些技术共同将 Orchard-SWE 从 SWE-bench Verified 上的 61.4% 基线提升到使用平衡自适应推演的 69.1% 和使用密集奖励技术的 69.7%——这是同等规模的开源模型中的新技术水平(大约 30 亿个活跃参数)——加上 value model 重排后上升到 73%,接近大 10 倍以上的前沿系统,如图 1 所示。
网页导航呈现了一组不同的挑战。Agent 必须解释视觉布局、与动态界面交互,以及完成仅用自然语言描述的开放式任务。
Orchard-GUI 使用相对较少的监督来训练一个 40 亿参数的视觉语言模型作为浏览器 Agent:400 个蒸馏演示结合 2,200 个开放式训练任务。尽管这个有限的训练数据,所得模型在多个网页导航基准上取得了很强的结果:WebVoyager 上 74.1%、Online-Mind2Web 上 67.0% 和 DeepShop 上 64.0%,平均为 68.4%,如图 1 所示。
图 1. 性能对比。左侧:Orchard-SWE(35B-A3B,约 30 亿活跃)在 SWE-bench Verified 上达到 69.7%——加上 value model 重排后为 73%——与大 10 倍以上的前沿系统匹配。右侧:Orchard-GUI(4B)在 WebVoyager、Online-Mind2web 和 DeepShop 上平均成功率达到 68.4%,是最强的开源 GUI Agent,与 OpenAI 和 Google 的专有系统相当。

这些结果使 Orchard-GUI 成为迄今为止最强的开源网页 Agent 之一,同时与更大的专有模型具有竞争力。这些结果也表明,使用正确的训练方法和环境,小型开源模型可以在真实网页任务上表现良好。
许多最具影响力的 Agent 应用涉及日常生产力任务,包括阅读和起草电子邮件、管理日历、搜索信息和跨工具协调。Orchard-Claw 专注于个人助手任务,通过在仅 200 个合成任务上训练 Agent。在 Claw-Eval 上评估,一个涵盖现实生产力工作流的基准,它在给定最多三次尝试时成功完成 59.6% 的任务。当与更强的 ZeroClaw Agent 系统配对时,这增加到 73.9%。
由于 Orchard 可以直接在真实部署环境中训练 Agent,Orchard-Claw 在多个环境中进行训练——包括 ReACT、ZeroClaw、OpenClaw 和 Codex——而不是单一简化循环。在这些真实环境中训练大大提高了 Agent 的可靠性;例如,在 Codex 环境下,其成功率从未训练模型的 18.6% 上升到 Orchard 训练后的 51.5%。
图 2. Orchard 框架概览。Orchard Env(中心)是一个轻量级的 Kubernetes 原生环境服务,提供共享功能,如沙箱管理、命令执行、文件访问、网络控制、REST API 和 Agent 集成。它支持多种任务环境(底行),并跨三个任务领域使用(顶行):Orchard-SWE(软件工程)、Orchard-GUI(网页导航)和 Orchard-Claw(AI 个人助手)。

Orchard 的结果强化了一个更广泛的点:环境层很重要。通过使底层基础设施开放、轻量和可复用,Orchard 降低了 Agent AI 研究的成本。团队不再需要从头构建定制的隔离环境或依赖专有云服务。同一个 Orchard Env 可用于生成训练数据、运行强化学习推演和评估最终模型,无需每次都重建系统。
展望未来,我们看到复用训练经验是通向累积 Agent 学习的一个有前景的方向。与其在训练运行完成后丢弃轨迹,我们将其视为持久资产——例如,将它们蒸馏成可复用的 value model。这使 Agent 经验能够随时间累积,让每一代新的 Agent 继承并扩展前一代 Agent 获得的知识,而不是从零开始。
Orchard-GUI 展现的数据效率表明,可以在不需要大量手动创建训练数据的情况下训练更大规模的网页 Agent。通过发布完整的 Orchard 堆栈,包括环境服务、训练流水线和训练数据集,我们希望帮助更广泛的研究社区更快地构建更强大的开源 Agent。
我们感谢 Microsoft Research 团队和合作机构对 Orchard 的贡献,以及开源社区提供的基准和工具,使这项研究成为可能。