阿里通义发布开源 DeepResearch 对标模型,规模 30B MoE,支持本地部署和商用。为程序员提供更多开源 AI 模型选择。
GITHUB HUGGINGFACE MODELSCOPE SHOWCASE
我们很自豪地推出 Tongyi DeepResearch——首个在一系列综合基准测试中达到与 OpenAI DeepResearch 相当性能的完全开源 Web 智能体。Tongyi DeepResearch 展现了业界领先的成果:在学术推理任务 Humanity’s Last Exam(HLE)中获得 32.9 分,在极其复杂的信息检索任务 BrowseComp 和 BrowseComp-ZH 中分别获得 43.4 分和 46.7 分,并在以用户为中心的 xbench-DeepSearch 基准测试中取得 75 分,全面超越现有所有闭源及开源的 Deep Research 智能体。
除了模型本身,我们还分享了一套完整且经过实战检验的方法论,用于构建此类高级智能体。我们的工作详细介绍了一种贯穿整个训练流水线的新型数据合成方案,覆盖从用于冷启动的智能体持续预训练(Agentic Continual Pre-training,CPT)和监督微调(Supervised Fine-Tuning,SFT),一直到最终的强化学习(Reinforcement Learning,RL)阶段。针对 RL,我们提供了一套全栈解决方案,包括算法创新、自动化数据筛选以及稳健的基础设施。在推理方面,原生 ReAct 框架无需任何提示词工程即可展现模型强大的内在能力,而高级 Heavy Mode(测试时扩展)则展示了模型在复杂推理和规划方面的潜力上限。
我们将 Agentic CPT 引入深度研究智能体训练,为后训练打造强大的智能体基础模型。我们提出了 AgentFounder,这是一种系统化、可扩展的大规模数据合成方案,利用后训练流水线产生的数据构建数据飞轮。
数据重组与问题构建。 我们持续从各种来源收集数据,包括文档、公开可用的网络爬取数据、知识图谱,以及历史轨迹和工具调用记录(例如带链接的搜索结果)。如图所示,这些不同来源的数据会被重构为以实体为锚点的开放世界知识记忆。我们基于随机采样的实体及其对应知识,生成多种风格的(问题,答案)对。
动作合成。 我们基于多样化的问题和历史轨迹,构建一阶动作合成数据与高阶动作合成数据。我们的方法能够在离线环境中,对潜在的推理—动作空间进行大规模、全面的探索,从而无须额外调用商业工具 API。具体而言,在高阶动作合成中,我们将轨迹重新建模为多步决策过程,以增强模型的决策能力。
我们开发了一套端到端的合成数据生成方案。这一完全自动化的流程无须任何人工干预,即可构建超越人类水平的高质量数据集,旨在突破 AI 智能体的性能边界。经过长期探索与迭代——从早期基于点击流反向构建问答对的方法(WebWalker),到更加系统化的基于图的合成方法(WebSailor 和 WebSailor-V2),再到形式化任务建模(WebShaper)——我们的方法既保证了卓越的数据质量,也实现了大规模扩展,从而突破模型能力的上限。
为解决复杂且高度不确定的问题,我们通过一种新颖的流水线合成基于 Web 的问答数据。该流程首先通过随机游走构建高度互联的知识图谱,并针对表格数据进行同构表处理,以融合现实世界网站中的表格数据,从而确保信息结构的真实性。随后,我们从中采样子图和子表,以生成初始问题与答案。关键步骤是通过有策略地混淆或模糊问题中的信息,有意提升问题难度。这一实用方法建立在一套完整的理论框架之上:我们将问答难度形式化建模为一系列针对实体关系的可控“原子操作”(例如,合并具有相似属性的实体),从而能够系统性地提升复杂度。
为了进一步减少整理后的信息结构与问答推理结构之间的不一致,实现对推理难度和结构扩展更加可控的调节,我们提出了一种基于集合论的信息检索问题形式化建模方法。基于这一形式化方法,我们开发了能够以可控方式扩展问题的智能体,并将推理捷径和结构冗余降至最低,从而进一步提升问答质量。此外,这种形式化建模还支持高效验证问答的正确性,有效解决了后训练阶段合成信息检索数据难以验证的问题。
此外,我们还开发了一套自动化数据引擎,用于大规模生成博士级研究问题。该引擎从一个多学科知识库开始,生成需要进行多来源推理的“种子”问答对。随后,每个种子都会进入一个自主引导的“迭代式复杂度升级”循环,其中的问题构建智能体配备了一套强大的工具,包括 Web 搜索、学术资料检索和 Python 执行环境。在每次迭代中,智能体都会扩展知识边界、深化概念抽象,甚至构建计算任务,从而形成良性循环:一轮的输出会成为下一轮更加复杂的输入,确保任务难度能够以可控、系统化的方式逐步提升。
为了引导模型形成初始能力,我们基于 ReAct 和 IterResearch 框架,通过拒绝采样构建了一组轨迹(详情见下文)。一方面,ReAct 作为一种经典且基础的多轮推理格式,能够为模型注入丰富的推理行为,并增强其遵循结构化格式的能力。
另一方面,我们引入了创新的智能体范式 IterResearch(详见下文)。它通过在每一轮中动态重建精简的工作空间,释放模型的全部推理潜力,确保每个决策都经过审慎思考。借助 IterResearch,我们构建了一组融合推理、规划和工具使用的轨迹,从而增强模型在面对长程任务时持续规划的能力。
我们对 DeepResearch 类智能体的 rollout 范式进行了广泛探索。因此,我们的最终模型支持多种 rollout 格式,包括原生 ReAct Mode 和具备上下文管理能力的 Heavy Mode。
我们的模型无需任何提示词工程,仅使用原生 ReAct 推理范式即可展现出色性能。它严格遵循 Thought-Action-Observation 循环,通过多轮迭代解决问题。模型的上下文长度为 128K,能够处理大量交互轮次,充分实现与环境交互时的规模扩展。ReAct 的简洁性与通用性,为衡量模型的内在能力以及我们的训练流水线是否有效提供了最清晰的基准。
我们选择 ReAct,在很大程度上受到了“The Bitter Lesson”的启发。该观点认为,利用可扩展计算的通用方法,最终会超越依赖复杂人工知识和精巧设计的方法。
除原生 ReAct Mode 外,我们还针对复杂的多步研究任务开发了“Heavy Mode”。该模式建立在全新的 IterResearch 范式之上,旨在将智能体的能力推向极限。
IterResearch 范式旨在解决智能体将所有信息累积到单一且不断扩张的上下文中时产生的“认知窒息”和“噪声污染”问题。与之不同,IterResearch 会将任务拆解为一系列“研究轮次”。
在每一轮中,智能体仅使用上一轮最关键的输出,重新构建一个精简的工作空间。在这个聚焦的工作空间内,智能体会分析问题,将关键发现整合进一份持续演进的核心报告中,然后决定下一步行动——继续收集更多信息,或给出最终答案。这一“综合与重构”的迭代过程,使智能体能够在长时任务的整个过程中保持清晰的“认知焦点”和高质量的推理。
训练这样的智能体模型要求我们重新思考整个模型训练管道,从预训练到微调再到强化学习。我们建立了一个新的智能体模型训练范式,连接 Agentic CPT → Agentic SFT → Agentic RL,为 AI 智能体创造了一个无缝的端到端训练循环。以下是我们如何应对最后阶段的强化学习,这对于使智能体行为与高层目标对齐至关重要:
通过 RL 构造高质量智能体是一个复杂的系统工程挑战;如果将整个开发过程视为一个"强化学习"循环,其任何组件中的不稳定或缺乏鲁棒性都会导致错误的"奖励"信号。我们现在将分享我们在 RL 中的实践,涵盖算法和基础设施两个方面。
在 RL 算法方面,我们实现了多项算法突破,使用了定制的在策略组相对策略优化(GRPO)。我们采用严格的在策略训练方案,确保学习信号始终与模型的当前能力相关。训练目标使用 token 级别的策略梯度损失进行优化。其次,为了进一步降低优势估计中的方差,我们采用了留一法策略。此外,我们对负样本采用了保守策略,因为我们观察到未经过滤的负轨迹集合会显著降低训练稳定性。这可能在长时间训练后表现为"格式坍塌"现象。为了缓解这种情况,我们有选择地从损失计算中排除某些负样本,例如那些因为超过长度限制而未产生最终答案的样本。为了效率,我们不采用动态采样。我们改为使用更大的批次和组大小,这有助于保持较小的方差并提供充分的监督。
训练动态展示了有效的学习,奖励呈现持续上升趋势。同时,策略熵保持一致的高水平,表示持续的探索并防止过早收敛。我们将其归因于网络环境的非平稳性,这自然促进了鲁棒自适应策略的形成,消除了显式熵正则化的需要。
我们认为算法很重要,但不是 Agentic RL 成功的唯一决定性因素。我们尝试了许多不同的算法和技巧,发现数据和训练环境的稳定性可能是决定 RL 是否有效的更关键因素。有趣的是,我们测试了直接在 BrowseComp 测试集上训练模型,但结果远不如使用我们的合成数据。我们假设这种差异产生的原因是合成数据提供了更一致的分布,这允许模型被更有效地定制。相反,人工标注的数据(如 BrowseComp)本质上更嘈杂。考虑到其规模有限,很难逼近一个可学的基础分布,这随后阻碍了模型从中学习和泛化。
在基础设施方面,用工具训练智能体要求我们开发高度稳定和高效的环境:
合成训练环境: 依赖实时网络 API 进行开发既昂贵、速度慢,也不一致。我们通过使用离线 Wikipedia 数据库和定制工具套件创建模拟训练环境来解决这个问题。通过调整我们的数据管道为该环境生成高质量、复杂的任务,我们创建了一个具有成本效益、速度快、可控的平台,大大加速了我们的研究和迭代。
合成训练环境: 依赖实时网络 API 进行开发既昂贵、速度慢,也不一致。我们通过使用离线 Wikipedia 数据库和定制工具套件创建模拟训练环境来解决这个问题。通过调整我们的数据管道为该环境生成高质量、复杂的任务,我们创建了一个具有成本效益、速度快、可控的平台,大大加速了我们的研究和迭代。
稳定高效的工具沙箱: 为了确保智能体训练和评估过程中的可靠工具使用,我们开发了一个统一的沙箱。沙箱通过缓存结果、重试失败的调用和使用冗余提供商作为备用(例如备用搜索 API),优雅地处理并发和故障。这为智能体提供了快速和确定的体验,这对于防止工具错误破坏其学习轨迹至关重要。
稳定高效的工具沙箱: 为了确保智能体训练和评估过程中的可靠工具使用,我们开发了一个统一的沙箱。沙箱通过缓存结果、重试失败的调用和使用冗余提供商作为备用(例如备用搜索 API),优雅地处理并发和故障。这为智能体提供了快速和确定的体验,这对于防止工具错误破坏其学习轨迹至关重要。
自动数据策展: 数据是模型能力增强的核心驱动力;其重要性甚至超过了算法。数据的质量直接决定了模型通过自探索泛化到分布外场景的能力上界。为了应对这个挑战,我们在训练动态的指导下实时优化数据。这种优化通过一条完全自动化的数据合成和过滤管道实现,该管道动态调整训练集。通过闭合数据生成和模型训练之间的循环,这种方法不仅确保了训练稳定性,还带来了显著的性能收益。
自动数据策展: 数据是模型能力增强的核心驱动力;其重要性甚至超过了算法。数据的质量直接决定了模型通过自探索泛化到分布外场景的能力上界。为了应对这个挑战,我们在训练动态的指导下实时优化数据。这种优化通过一条完全自动化的数据合成和过滤管道实现,该管道动态调整训练集。通过闭合数据生成和模型训练之间的循环,这种方法不仅确保了训练稳定性,还带来了显著的性能收益。
在策略异步框架: 我们在 rLLM 的基础上实现了自定义的步级异步 RL 训练循环。多个智能体实例与(模拟或真实)环境并行交互,每个都产生轨迹。
在策略异步框架: 我们在 rLLM 的基础上实现了自定义的步级异步 RL 训练循环。多个智能体实例与(模拟或真实)环境并行交互,每个都产生轨迹。
通过这些措施,我们在智能体训练上"闭环"。从原始模型开始,我们进行了 Agentic 预训练以初始化工具使用技能,然后在专家级数据上进行监督微调以冷启动,最后通过在策略 RL 让模型进行自我演化。这种全栈方法——现已通过 Tongyi DeepResearch 证实——为训练能够在动态环境中稳健解决复杂任务的 AI 智能体呈现了新范式。
(我们的 RL 方法受到来自 Agentica 的多项过去工作的启发。我们采用了他们的 rLLM 框架并将其扩展以训练我们的网络智能体。)
Tongyi DeepResearch 不仅仅是一个研究展示;它已经在阿里巴巴内部及其他地方驱动真实应用,在实际场景中展示了其价值:
高德 Mate(地图与导航智能体): 与高德地图团队合作,我们共同开发了"小高",一个利用应用丰富工具集的 AI 副驾驶。它可以执行复杂的旅行规划命令,比如创建包含特定景点和宠物友好酒店的多日驾车游。通过多步推理,小高自主研究和整合信息以生成详细的个性化行程,提供了远超标准导航的智能规划体验。
通义 FaRui(法律研究智能体):得益于我们的 DeepResearch 架构,FaRui 现已发展为真正的法律智能体。它能够自主执行复杂的多步骤研究任务,模拟初级律师的工作流程——系统地检索判例法、交叉引用法规并综合分析。更重要的是,所有结论都基于可验证的司法来源,并附带精确的案例和法规引用,确保专业级的准确性和可信度。
我们的未来工作将解决三个关键限制。首先,当前 128k 的上下文长度对于最复杂的长期任务仍然不足,需要我们探索扩展的上下文窗口和更精细的信息管理。其次,我们的训练管道在远大于 30B 规模混合专家模型的基础模型上的可扩展性仍未得到验证,我们计划在更大规模的模型上验证我们的方法。最后,我们旨在通过研究部分回滚等技术来改进强化学习框架的效率,这将需要解决离策略训练的挑战,如分布偏移。
通义 DeepResearch 还拥有广泛的深度研究智能体族群。您可以在以下论文中找到更多信息:
[1] WebWalker: Benchmarking LLMs in Web Traversal
[2] WebDancer: Towards Autonomous Information Seeking Agency
[3] WebSailor: Navigating Super‑human Reasoning for Web Agent
[4] WebShaper: Agentically Data Synthesizing via Information‑Seeking Formalization
[5] WebWatcher: Breaking New Frontier of Vision‑Language Deep Research Agent
[6] WebResearch: Unleashing reasoning capability in Long‑Horizon Agents
[7] ReSum: Unlocking Long‑Horizon Search Intelligence via Context Summarization
[8] WebWeaver: Structuring Web‑Scale Evidence with Dynamic Outlines for Open‑Ended Deep Research
[9] WebSailor‑V2: Bridging the Chasm to Proprietary Agents via Synthetic Data and Scalable Reinforcement Learning
[10] Scaling Agents via Continual Pre‑training
[11] Towards General Agentic Intelligence via Environment Scaling
我们的团队长期致力于深度研究智能体的研发。在过去的六个月里,我们始终坚持每月发布一份技术报告,迄今已发布五份。今天,我们很高兴同时发布六份新报告,并与社区分享我们的通义 DeepResearch-30B-A3B 模型。
敬请期待我们下一代智能体模型。
@misc{tongyidr,
author={Tongyi DeepResearch Team},
title={Tongyi DeepResearch: A New Era of Open-Source AI Researchers},
year={2025},
howpublished={\url{https://github.com/Alibaba-NLP/DeepResearch}}
}