Hugging Face支持的OpenEnv项目用于Agent强化学习,代表开源在Agent领域的新动向。
OpenEnv 是一个用于创建 Agent 执行环境的工具,如终端、浏览器或任何 Agent 可以交互的东西。今天,我们很兴奋地宣布,OpenEnv 正在变得更加开放,以使 Agent 训练的未来开源化。
从今天开始,OpenEnv 将由一个委员会协调,目前包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia、Mercor、Fleet AI、Microsoft、Hugging Face 和 RadixArk。OpenEnv 现在位于 huggingface/OpenEnv
OpenEnv 项目得到了 AI 生态系统中一些领先组织的支持和采用,包括 PyTorch Foundation、vLLM、SkyRL (UCB)、Lightning AI、Axolotl AI、Stanford Scaling Intelligence Lab、Mithril、OpenMined、Scaler AI Labs、Scale AI、Patronus AI、Surge AI、Halluminate、Turing、Scorecard、Snorkel AI、SGLang 和 Miles。
像 Claude Code、Codex、OpenClaw 和 Hermes 这样的 Agent 工具链在不断改进。它们改进的一个原因是,像 GPT-5.5 和 Opus 4.8 这样的模型被训练来使用它们各自的工具链。
我们也希望在开源模型中获得这些收益:训练能有效使用工具链的本地模型,并通过为特定任务专门化模型来节省计算。
前沿实验室训练的模型和工具链大多配合得相当好。模型被训练来使用工具链并针对其特性进行优化。模型在某种程度上可以超越这些工具链进行泛化,但没有什么能比得上训练的效率。
在开源社区中,情况并非如此。开发者使用任何工具链、任何模型、任何推理引擎,用于他们重视的任何用例。这是社区的基础,但也是一个需要基础设施和工具来解决的挑战。
这就是 OpenEnv 的用武之地。它是一个在工具链、环境和训练器之间进行接口的库,适用于任何模型。为了让这个方案可行,它需要由所有主要利益相关者拥有。
除了治理的改变之外,我们还在明确 OpenEnv 的定位。
在最近的版本中,OpenEnv 已成为 RL 环境的互操作性层。它的工作是标准化环境如何被发布、部署和被 Agent 消费。它不会规定如何定义奖励或训练循环如何工作。奖励定义、评分标准和训练器特定逻辑属于专门处理它们的库。OpenEnv 是所有这些都可以插入的通用接口。
实际上,这意味着:
一个接口,多个环境,都暴露熟悉的 Gymnasium 风格的 API(reset()、step()、state()),运行在客户端/服务器架构上。一个支持 OpenEnv 的训练器可以驱动任何符合规范的环境,而无需自定义代码。
熟悉的协议和规范化打包。环境通过 HTTP 和 WebSocket 等标准协议提供,并使用 Docker 打包。MCP 是一流的公民,因此 OpenEnv 环境与 MCP 服务器即时兼容,同一环境在模拟(训练/评估)和生产模式中表现一致。
跨环境库的互操作性。你可以在不同的生态系统(验证器、harbor 等)和你选择的基础设施和中心上定义和使用环境。OpenEnv 是它们下面的部署和接口层,而不是竞争者。
在接下来的几个月里,我们将专注于将 OpenEnv 从一个快速增长的项目转变为可靠标准的事项:
外部奖励:让奖励在你已经使用的任何库中定义,OpenEnv 作为部署层(RFC 006)。
通过数据集的任务集:将环境任务与 Hugging Face 数据集关联,以便环境和基准能够干净地组合(RFC 007)。
继续工具链集成:为 Agent 工具链提供一流支持。
端到端示例:TRL、Unsloth、Miles 等中的完整训练和评估演练。
自动验证:测量环境质量和对模型学习的贡献。这将为社区提供一种可扩展的方式来评估他们的环境并提高质量(想象黑客马拉松!)。RFC 008。
OpenEnv 在设计上以社区为中心,仍处于早期阶段——期待粗糙的边缘,帮助我们平滑它们。查看代码和 RFC:github.com/huggingface/OpenEnv
感谢所有帮助实现这一过渡的人。让我们一起为开源 Agent RL 构建通用基础设施。
博客中的更多文章
OpenEnv 实践:在真实环境中评估工具使用 Agent
共同构建开放 Agent 生态系统:介绍 OpenEnv
这里有一些很好的工作要检查。https://a2eprotocol.github.io/docs/
注册或登录以评论