在SageMaker上用多轮强化学习(MTRL)微调LLM搜索Agent,测量结果显示检索质量和可靠性显著提升,同时降低延迟和成本。
由大型语言模型(LLM)驱动的搜索智能体正在改变企业的信息检索方式。搜索智能体不需要用户精心构造完美的查询,它能够自主决定搜索什么、使用哪种检索策略、以及何时停止搜索。它通过多轮交互完成这些操作,并基于已检索到的内容不断优化策略。
然而,要让这种多步骤行为良好运行是困难的。没有任何基础模型生来就了解你的工具或环境。如果使用小模型进行提示,你很少能得到可靠的多轮行为。而使用前沿模型虽然通常有效,但你要为这种能力付出延迟和成本的代价。微调提供了第三条路径:你可以直接向小模型传授你的工具和环境,其结果是获得小模型的速度和成本,同时具备原本只有前沿模型才能提供的可靠性。
尽管微调是自然而然的下一步,但传统方法各有缺陷。监督微调(SFT)依赖于理想多轮轨迹的专家演示,这些演示成本高昂且通常在你的特定设置中根本不存在。单轮强化学习(RL),如基于可验证奖励的强化学习(RLVR),每次只对一个响应打分。但搜索智能体在多轮中做出相互依赖的决策,每轮都建立在前一轮的上下文之上。孤立地优化单个步骤会完全忽略这些依赖关系。
你需要的是一种在整个多轮轨迹上优化智能体的训练方法。奖励信号只需要反映最终结果是否良好。这正是多轮强化学习(MTRL)所提供的。它训练智能体在完整的步骤序列中做出好的决策,将你的环境特定行为融入其中,并让你控制输出质量。由于你运行的是一个更小的专业化模型,你还能获得更快、更便宜的推理。
在本文中,我们描述了如何使用 Amazon SageMaker AI 多轮强化学习(MTRL)微调搜索智能体,并分享我们在检索质量和可靠性方面观察到的结果。我们首先解释什么是 Amazon SageMaker AI MTRL 及其工作原理。
使用 Amazon SageMaker AI MTRL,你可以在多轮交互环境中使用强化学习微调 LLM。它将智能体任务框架为一序列的决策,使用多轮 rollout 生成训练数据,并使用策略梯度算法优化模型。
Amazon SageMaker AI MTRL 提供以下特性:
模块化智能体-环境接口:保持低代码集成。你可以定义自定义奖励、自定义工具循环和多轮对话形式。
无服务器执行:以按 token 计费的价格获得生产级智能体强化学习,无需配置或管理 GPU 集群。
异步 rollout 和轨迹收集:你可以并行运行生成和梯度更新,同时保持有界的离策略过期时间,因此训练保持快速而不会偏离当前策略太远。
原生算法库:你可以从近端策略优化(PPO)、剪裁重要性采样策略优化(CISPO)和重要性采样(IS)损失中选择,并与基于组优势估计器(GRPO、GRPO pass@k、RLOO 等)配对。
可恢复训练:你可以将长期训练任务分散到多个任务中,以突破单个任务的时间限制。
轨迹和奖励可观测性:你可以在 Amazon SageMaker AI 管理的 MLflow 中逐轮检查智能体的行为以及跨训练步骤的情况。
评估任务:你可以在部署到 Amazon SageMaker AI 端点或 Amazon Bedrock 之前报告 reward、pass@k 和轨迹指标。
这使得 MTRL 成为搜索智能体的天然选择:你有清晰的奖励信号(检索质量)、多轮交互循环(智能体发出查询并接收结果)以及定义良好的环境(搜索工具)。
我们的设置依赖以下条件:
在本文中,我们使用 Amazon SageMaker AI MTRL 为搜索智能体微调 Qwen3.6-27B 模型(该模型在美国西部(俄勒冈)区域(us-west-2)受支持)。搜索智能体是一个由 LLM 驱动的系统,能够自主使用搜索工具来查找、收集和综合信息,以回答问题或完成任务。
我们关注企业搜索场景,其中智能体有两个可用工具:
词法搜索(BM25):通过计算词频找到精确的关键词匹配。适用于包含特定术语或标识符的查询。
向量搜索:将查询和文档转换为嵌入向量并计算相似度。这推荐用于语义或概念性查询。
我们还限制了轮次数量(一轮是用户与助手的一次交互),防止智能体生成过长的响应并鼓励高效搜索行为。
本节介绍训练设置的三个关键组件:数据集、奖励函数和 MTRL 任务配置。
我们使用以下数据集进行训练和测试:
我们根据文档将数据集预处理为 MTRL 服务可识别的格式。我们进一步从每个数据集中保留 5% 的训练样本作为验证样本。
我们的主要指标是 nDCG@10(排名第 10 位的归一化折损累积增益)。nDCG@10 是一个标准的信息检索指标,用于衡量前 10 个检索文档与理想排名的匹配程度。它奖励将高度相关的文档放在列表顶部的系统,1.0 分意味着完美排名,0.0 分意味着没有检索到相关文档。我们直接将 nDCG@10 作为 MTRL 中的奖励函数。这是一个轨迹级奖励,智能体完成完整的多轮搜索后,根据最终检索文档与真实标签的匹配程度获得奖励。
当智能体达到最大轮次或单轮最大采样 token 数时,我们分配 -1 的奖励以明确教导模型避免这些失败模式。这种基于惩罚的奖励设计有效地引导模型远离不良行为,无需手工设计复杂的中间奖励。
Amazon SageMaker AI MTRL 的吸引力之一是你需要配置的内容很少。我们修改了三个超参数,其余全部使用默认值。以下代码片段展示如何使用 MultiTurnRLTrainer SDK 配置和启动训练任务:
from sagemaker.modules.train import MultiTurnRLTrainer
trainer = MultiTurnRLTrainer(
model_id="qwen3.6-27b",
agent_endpoint="<your-agent-endpoint>",
training_dataset_s3_uri="s3://amzn-s3-demo-bucket/datasets/train/",
validation_dataset_s3_uri="s3://amzn-s3-demo-bucket/datasets/validation/",
hyperparameters={
"max_epochs": 1,
"global_batch_size": 128,
"rollout_max_concurrency": 32,
},
output_s3_uri="s3://amzn-s3-demo-bucket/output/",
)
trainer.train()
我们修改的关键超参数是:
这就是整个设置。通常需要强化学习专业知识的选项——算法、优势估计器、离策略过期边界——都使用默认值运行。从基础模型到下一节的结果,只需要上述配置即可。
MTRL 微调在四个保留基准中的三个上提升了搜索智能体性能,并显著提高了所有基准的可靠性。最大提升来自 BrowseComp-Plus(+23.7% nDCG@10)和 WixQA(+18.4%),Wands 有较小提升,FreshStack 略有下降。可靠性提升是更显著的结果。在 BrowseComp-Plus 上,失败率从 22.89% 降至 0.68%。这意味着智能体不仅学会了更好地搜索,还学会了在其轮次和 token 预算内完成任务。以下部分将详细介绍训练曲线和每个基准的数据。
下图展示了训练过程中训练样本和验证样本上的奖励(nDCG@10)。x 轴表示训练步,y 轴表示 nDCG@10 分数。两条线追踪训练和验证奖励,均在 plateau 前稳步上升。MTRL 训练可能持续多天,MTRL 服务的默认时间限制为 24 小时,可通过 CreateJob JSON schema 调整。如果任务因超时或基础设施错误而停止或失败,你可以使用恢复支持从上一个检查点继续训练。

该图绘制了训练集和验证集的 nDCG@10 与训练步的关系。两条曲线都随着微调的进行而稳步增加,并在训练结束时饱和,表明进一步训练不会有更多收益。
下表将微调后的模型与原始 Qwen3.6-27B 在四个保留测试数据集上进行了比较。表中所有指标均来自我们对上一节列出的数据集的评估运行。
结果表明 RL 微调产生了有意义的差异:
更好的搜索质量:如下表所示,nDCG@10 在 WixQA 上有所提升(从 0.5725 到 0.6781,提升 18.4%),在 Wands 上(从 0.5762 到 0.6112,提升 6%),在 BrowseComp-Plus 上(从 0.5136 到 0.6354,提升 23.7%)。FreshStack 上的分数略有下降。
更少的失败:为失败案例分配 -1 的奖励非常有效。在 BrowseComp-Plus 上,失败率从 22.89% 下降到仅 0.68%。
如果你确实探索了这种方法,请记住之后清理资源以避免持续产生费用:
在本文中,我们描述了使用 Amazon SageMaker AI MTRL 通过强化学习微调 LLM 驱动的搜索智能体的经验。通过最少的配置,微调后的模型在检索质量、失败率和轮次效率(每个问题更少的轮次)方面都有显著改善。
我们使用 Amazon SageMaker AI MTRL 的经验关键要点:
低门槛:默认配置效果良好,无需深度 RL 专业知识即可开始。
无服务器基础设施:无需配置 GPU 或管理分布式训练集群。按 token 付费。
可恢复训练:长期训练可以分散到多个任务中。
直接优化:你根据实际任务指标而不是代理损失进行训练。
完整的可观测性:你可以在 Amazon SageMaker AI 管理的 MLflow 中逐轮检查轨迹,了解智能体学到了什么。
如果你想将这种方法应用到你自己的智能体,这里有一些有用的起点: