ART:开源强化学习框架
用于自动化 agent 训练的强化学习框架。主要面向 AI 研究人员,对普通开发者的直接应用价值有限。
用于自动化 agent 训练的强化学习框架。主要面向 AI 研究人员,对普通开发者的直接应用价值有限。
使用 GRPO 为真实场景任务训练多步 agent。
W&B Training(无服务器强化学习)是首个公开可用的服务,支持用强化学习灵活训练模型。它自动管理训练和推理基础设施,让你专注于定义数据、环境和奖励函数——从而实现更快的反馈循环、更低的成本和更少的 DevOps 烦恼。
40% 更低成本 - 共享生产级推理集群的多路复用
28% 更快训练速度 - 跨多个 GPU 扩展至 2000+ 并发请求
零基础设施烦恼 - 完全托管的基础设施,保持健康运行
即时部署 - 每个 checkpoint 都通过 W&B Inference 即时可用
# 之前:GPU 设置和基础设施管理耗时数小时
# RuntimeError: CUDA error: out of memory 😢
# 之后:无服务器强化学习,即时反馈
from art.serverless.backend import ServerlessBackend
model = art.TrainableModel(
project="voice-agent",
name="agent-001",
run_name="agent-001",
base_model="Qwen/Qwen3.6-27B"
)
backend = ServerlessBackend(
api_key="your_wandb_api_key"
)
model.register(backend)
# 数分钟内编辑和迭代,而非数小时!
📖 了解更多关于 W&B Training →
ART 是一个开源强化学习框架,通过让 LLM 从经验中学习来提高 agent 的可靠性。ART 为将 GRPO 集成到任何 python 应用提供了一个符合人体工学的 harness。如需快速上手,可以运行下面的 notebook。准备好深入学习时,可以查阅文档。
浏览我们关于构建 SOTA agent 的最新研究和更新。
🗞️ ART 现已与 LangGraph 无缝集成 - 用强化学习训练你的 LangGraph agent,实现更聪明的多步推理和改进的工具使用。
🗞️ MCP•RL:教你的模型掌握任何 MCP Server - 通过强化学习自动训练模型有效使用 MCP server 工具。
🗞️ AutoRL:任何任务零数据训练 - 使用自动输入生成和 RULER 评估来训练自定义 AI 模型,无需标记数据。
🗞️ RULER:强化学习奖励的简单模式现已可用于强化学习中的自动奖励生成。
🗞️ ART·E:我们如何构建击败 o3 的电子邮件研究 Agent - 展示了一个 Qwen 2.5 14B 电子邮件 agent 的性能优于 OpenAI 的 o3。
🗞️ ART Trainer:Agent 的新一代强化学习训练器 - 使用 GRPO 轻松训练基于 LLM 的 agent。
📖 查看所有博客文章 →
ART 提供便捷的 wrapper,用于在现有应用中引入强化学习训练。我们将训练服务器抽象为一个模块化服务,你的代码无需与之交互。
从任何地方训练。在你的笔记本电脑上运行 ART 客户端,让 ART 服务器启动一个临时的 GPU 启用环境,或在本地 GPU 上运行。
与 W&B、Langfuse 和 OpenPipe 等托管平台的集成提供了灵活的可观测性,并简化了调试。
ART 可自定义且具有智能默认值。你可以配置训练参数和推理引擎配置以满足特定需求,或利用已针对训练效率和稳定性优化的默认值。
ART agent 可以从运行 python 的任何客户端机器进行训练。若要添加到现有项目,运行此命令:
pip install openpipe-art
想知道如何在真实场景任务中使用 ART?请查看 ART•E Agent 博客文章,其中我们详细介绍了如何训练 Qwen 2.5 14B 在电子邮件检索中击败 o3 的过程!
ART 的功能分为客户端和服务器两部分。OpenAI 兼容的客户端负责在 ART 和你的代码库之间进行接口连接。使用该客户端,你可以当模型改进时从 LLM 传递消息并获得完成。服务器独立运行在任何配备 GPU 的机器上。它抽象掉了强化学习循环的推理和训练部分的复杂性,同时允许一些自定义配置。训练循环的概览如下:
推理 你的代码使用 ART 客户端执行 agentic 工作流(通常并行执行多个 rollout 以更快地收集数据)。完成请求被路由到 ART 服务器,该服务器在 vLLM 中运行模型的最新 LoRA。当 agent 执行时,每条系统、用户和助手消息都存储在一个 Trajectory 中。当一个 rollout 完成时,你的代码给其 Trajectory 分配一个奖励,表示 LLM 的性能。
你的代码使用 ART 客户端执行 agentic 工作流(通常并行执行多个 rollout 以更快地收集数据)。
完成请求被路由到 ART 服务器,该服务器在 vLLM 中运行模型的最新 LoRA。
当 agent 执行时,每条系统、用户和助手消息都存储在一个 Trajectory 中。
当一个 rollout 完成时,你的代码给其 Trajectory 分配一个奖励,表示 LLM 的性能。
训练 当每个 rollout 完成后,Trajectory 被分组并发送到服务器。训练执行期间推理被阻塞。服务器使用 GRPO 训练你的模型,从最新 checkpoint 初始化(或在第一次迭代时初始化一个空的 LoRA)。服务器将新训练的 LoRA 保存到本地目录并将其加载到 vLLM 中。推理被解除阻塞,循环在步骤 1 处恢复。
当每个 rollout 完成后,Trajectory 被分组并发送到服务器。
训练执行期间推理被阻塞。
服务器使用 GRPO 训练你的模型,从最新 checkpoint 初始化(或在第一次迭代时初始化一个空的 LoRA)。
服务器将新训练的 LoRA 保存到本地目录并将其加载到 vLLM 中。
推理被解除阻塞,循环在步骤 1 处恢复。
此训练循环持续运行,直到指定的推理和训练迭代次数完成。
ART 应该可以配合大多数 vLLM/HuggingFace-transformers 兼容的因果语言模型工作,或至少是 Unsloth 支持的模型。Gemma 3 暂时似乎不受支持。如果任何其他模型对你不起作用,请在 Discord 上告诉我们或在 GitHub 上开 issue!
ART 在积极开发中,我们欢迎任何贡献!详见 CONTRIBUTING.md 文件。
@misc{hilton2025art,
author = {Brad Hilton and Kyle Corbitt and David Corbitt and Saumya Gandhi and Angky William and Bohdan Kovalevskyi and Andie Jones},
title = {ART: Agent Reinforcement Trainer},
year = {2025},
publisher = {GitHub},
journal = {GitHub repository},
howpublished = {\url{https://github.com/openpipe/art}}
}
本仓库的源代码在 Apache-2.0 License 下可用。
ART 站在巨人的肩膀上。虽然我们从开源强化学习社区获得了许多导致 ART 开发的想法和早期实验,但我们尤其感谢以下项目的作者:
最后,感谢帮助我们在实际应用中测试 ART 的合作伙伴!我们期待看到你用它构建的所有东西。