☰
Tongyi DeepResearch Technical Report——Tongyi DeepResearch 技术报告
2026/10/10 2:41:44 网站建设 项目流程

《Tongyi DeepResearch 技术报告》介绍了阿里巴巴通义实验室开发的一个开源深度研究智能体模型Tongyi DeepResearch。以下是对其主要研究内容的全面总结概括:

一、研究背景与目标

随着通用人工智能(AGI)的发展,深度研究智能体成为增强人类智力生产力的重要范式。这类智能体能够自主在互联网上进行多步推理和信息检索,完成复杂研究任务。然而,现有深度研究系统大多闭源,缺乏系统化方法论和公开模型。

Tongyi DeepResearch 的目标是:构建一个完全开源的深度研究智能体,赋予大语言模型自主规划、搜索、推理和综合知识的能力,推动社区研究和智能体智能的民主化。

二、核心设计原则

1. 智能体训练流水线

  • 中程训练(Mid-training):在预训练和后训练之间引入智能体持续预训练(Agentic CPT),赋予基础模型智能体归纳偏差,弥合预训练与后训练之间的差距。

  • 后训练(Post-training):通过监督微调(SFT)冷启动 + 智能体强化学习(RL),进一步内化深度研究能力。

2. 以合成数据为中心的扩展

  • 研究级问题难以自然获取,人工标注成本极高。

  • 采用全自动合成数据流水线,生成高质量、可验证、超人类水平的问题-答案对。

  • 合成数据优势:易扩展、可针对元能力增强、易验证、可形成数据飞轮。

3. 通过环境交互学习

将环境分为三类,平衡稳定性、保真度和成本:

  • 先验世界环境:零成本、无限扩展,但无真实反馈。

  • 模拟环境:可控、低成本,但存在模拟到现实的差距。

  • 真实世界环境:最真实,但成本高、非平稳。

策略:中程训练主要用前两类环境;后训练先在模拟环境验证,再部署到真实环境。

三、技术方法

1. 形式化框架

  • 基于ReAct 范式:思考(Thought)→ 动作(Action)→ 观察(Observation)循环。

  • 上下文管理:基于马尔可夫状态重构,每步仅保留问题、演化报告和最近交互,避免上下文溢出,支持任意深度探索。

2. 智能体中程训练(Agentic CPT)

  • 两阶段:32K → 128K 上下文长度。

  • 合成数据覆盖智能体工作流全生命周期:问题合成、规划动作、推理动作、决策动作。

  • 通过环境扩展增强通用函数调用能力。

3. 智能体后训练

  • 高质量数据合成:知识图谱构建 → 子图采样 → 不确定性注入 → 生成复杂QA。

  • SFT 冷启动:混合 ReAct 模式和上下文管理模式,两阶段训练(40K → 128K)。

  • 智能体强化学习:

    • 基于 GRPO 改编,严格同策略训练。

    • 纯 0/1 奖励(答案正确性)。

    • 动态数据策划:自动过滤过易/过难问题,持续刷新训练集。

    • 异步展开框架提升训练效率。

  • 模型合并:加权平均多个模型变体,保留各自优势。

四、实验结果

1. 主要基准表现

Tongyi DeepResearch(30B-A3B,仅激活3.3B参数)在多个基准上达到最先进水平:

基准分数
Humanity's Last Exam32.9
BrowseComp43.4
BrowseComp-ZH46.7
GAIA70.9
xbench-DeepSearch75.0
WebWalkerQA72.2
FRAMES90.6
xbench-DeepSearch-251055.0

超越 OpenAI o3、DeepSeek-V3.1、Gemini DeepResearch 等强基线。

2. Heavy 模式

  • 并行研究 + 综合整合,利用测试时扩展。

  • Humanity's Last Exam 达 38.3%,BrowseComp-ZH 达 58.1%。

3. 详细分析

  • Pass@3:BrowseComp 59.64,BrowseComp-ZH 63.67,HLE 45.9。

  • 训练稳定性:奖励持续上升,熵稳定收敛。

  • 上下文长度影响:64K 模型性能最高;32K 模型被迫发现更高效解决方案。

  • 交互扩展:交互次数增加 → 性能持续提升。

  • 模拟到现实:模拟环境奖励曲线与真实环境高度一致。

  • 通用基准:AIME25、HMMT25、SimpleQA 上显著优于基础模型。

五、主要贡献与创新

  1. 端到端智能体训练范式:统一中程训练与后训练。

  2. 全自动合成数据流水线:无需人工标注,支持超人类水平数据生成。

  3. 阶段特定定制环境:先验世界、模拟、真实世界三类环境协同。

  4. 高效模型设计:30.5B 总参数,仅 3.3B 激活/token,性能超越更大模型。

  5. 完全开源:模型、框架、工具实现、复现脚本全部公开。

六、局限性与未来方向

局限性:

  • 128K 上下文仍不足以处理最复杂长周期任务。

  • 尚未发布更大规模模型。

  • 报告生成保真度和用户偏好对齐仍需改进。

  • RL 框架效率有待提升(如部分展开)。

  • 当前聚焦特定工具集,需扩展到更广泛智能体场景。

未来方向:

  • 从领域特定智能体走向通用智能体。

  • 开发下一代智能体基础模型,统一推理、记忆和自主性。

  • 持续推动开源,民主化智能体智能。

Tongyi DeepResearch 是一个开源、高效、可扩展的深度研究智能体,通过智能体中程训练 + 后训练、全自动合成数据和阶段特定环境,在多个深度研究基准上达到最先进性能。它标志着朝向更通用、自我改进智能的重要一步,并为社区提供了完整可复现的解决方案。这里是自己的论文阅读记录,感兴趣的话可以参考一下,如果需要阅读原文的话可以看这里,如下所示:

官方项目主页地址在这里,如下所示:

项目地址在这里,如下所示:

模型发布地址在这里,如下所示:

摘要

我们提出 Tongyi DeepResearch,一种智能体式大型语言模型,专为长周期、深度信息检索研究任务而设计。为激发自主深度研究能动性,Tongyi DeepResearch 通过端到端训练框架开发,该框架结合了智能体中程训练(agentic mid-training)与智能体后训练(agentic post-training),从而能够在复杂任务中实现可扩展的推理与信息检索。我们设计了一条高度可扩展的数据合成流水线,完全自动化,不依赖昂贵的人工标注,并赋能所有训练阶段。通过为每个阶段构建定制化环境,我们的系统能够在整个过程中实现稳定且一致的交互。Tongyi DeepResearch 总参数量为 305 亿,每个 token 仅激活 33 亿参数,在一系列智能体深度研究基准上达到最先进性能,包括 Humanity's Last Exam、BrowseComp、BrowseComp-ZH、WebWalkerQA、xbench-DeepSearch、FRAMES 和 xbench-DeepSearch-2510。我们开源了模型、框架和完整解决方案,以赋能社区。

图 1:Tongyi DeepResearch 的基准性能。

1 引言

随着我们迈向通用人工智能(AGI),深度研究智能体的出现为增强并可能解放人类智力生产力提供了一种有前景的范式。深度研究是一种新的智能体能力,能够自主地在互联网上对复杂研究任务进行多步推理和信息检索。它可以在几十分钟内完成,而人类原本需要数小时(OpenAI, 2025a; Claude Team, 2025; Grok Team, 2025; Gemini Team, 2025)。然而,大多数深度研究系统仍然是闭源的,其中间研究过程不可访问。尽管社区已在该领域进行了初步探索(Wu et al., 2025a; Li et al., 2025c; Tao et al., 2025),但仍缺乏系统化方法论和可完全开源、供社区共享的公开模型。

在本工作中,我们提出 Tongyi DeepResearch,开启开源 AI 研究者的时代。我们的目标是赋予大型语言模型(LLM)自主研究能力——即跨扩展动作序列和多样信息源进行规划、搜索、推理和综合知识的能力。

Tongyi DeepResearch 带来了若干关键进展:

  • 我们提出了一种端到端智能体训练范式,统一了智能体中程训练和智能体后训练,形成了深度推理和信息检索行为的可扩展基础。智能体中程训练通过让模型接触大规模、高质量智能体数据来培养其内在的智能体偏差,作为从预训练到后训练阶段的渐进过渡。智能体后训练则通过在强基础模型上进行可扩展多轮强化学习,进一步释放模型潜力。二者共同使模型能够从基本交互技能逐步发展到高级自主研究行为。

  • 我们设计了一条完全自动化、高度可扩展的数据合成流水线,无需人工标注,同时生成多样、高质量的智能体轨迹。我们设计了针对每个训练阶段目标量身定制的阶段特定数据合成策略,确保每个阶段都由结构适当、目标明确的数据支撑。合成数据高度可扩展、验证快速,并能够构建具有稳定分布的超人类水平数据集。它是智能体训练不可或缺的引擎。

  • 我们构建了阶段特定、定制化的环境,依赖稳健的基础设施,为跨训练阶段的数据合成提供一致交互。这些环境允许智能体进行丰富、专门的交互,与其发展阶段紧密对齐。它们可以采取多种形式,从先验世界模型到模拟环境和真实世界交互情境。

Tongyi DeepResearch 以显著更少的参数确立了新的最先进水平:总参数量为 305 亿,而每个 token 仅激活 33 亿,基于 Qwen3-30B-A3B-Base 模型(Yang et al., 2025)构建。深度研究基准上的实证评估证明了我们智能体的有效性。Tongyi DeepResearch 在 Humanity's Last Exam 上达到 32.9,在 BrowseComp 上达到 43.4,在 BrowseComp-ZH 上达到 46.7,在 WebWalkerQA 上达到 72.2,在 GAIA 上达到 70.9,在 xbench-DeepSearch 上达到 75.0,在 FRAMES 上达到 90.6,在 xbench-DeepSearch-2510 上达到 55.0,优于 OpenAI-o3(OpenAI, 2025b)和 DeepSeek-V3.1(DeepSeek Team, 2025)等强基线。我们还提供了系统性分析,涵盖智能体强化学习、合成数据,为深度研究智能体的开发提供关键洞见。此外,我们展示了 Tongyi DeepResearch 在通用基准上的性能,包括 AIME25、HMMT25 和 SimpleQA。我们相信,智能体模型代表了未来的新兴趋势,因为模型日益内化类智能体能力,并能够自主调用适当工具来解决广泛问题。

在后续章节中,我们首先概述 Tongyi DeepResearch 的设计原则。然后描述训练流水线,随后对其性能进行全面评估。我们发布模型、框架和端到端解决方案,以支持和加速社区研究。本技术报告总结了我们主要洞见,旨在启发朝向可扩展且强能力智能体系统的进一步进展。

2 设计原则

智能体训练流水线。智能体训练本质上比传统 LLM 训练更复杂、更具挑战性。我们在智能体训练流水线中引入两个阶段:中程训练和后训练。我们将中程训练直接整合进深度研究训练过程,并协同设计端到端同策略强化学习算法及其底层基础设施,以实现无缝可扩展性和稳定性。虽然大多数工作仅对 DeepResearch 智能体应用后训练阶段,我们新颖地为智能体学习引入中程训练。通用基础模型通常缺乏智能体归纳偏差。大多数通用基础模型通常先在从互联网抓取的纯文本上预训练,然后在指令遵循数据上后训练。这些数据集缺乏研究级问题和智能体行为,导致模型在后训练阶段同时学习智能体能力和对齐。在这些通用基础模型上进行智能体后训练可能导致次优结果和内在优化冲突。中程训练赋予预训练基础模型大量智能体先验知识,从而弥合预训练与智能体后训练之间的差距。中程训练阶段提供了强大的智能体基础模型,以支持有效的智能体后训练。在后训练期间,模型通过带监督微调(SFT)冷启动的强化学习进一步内化深度研究能力。SFT 教会模型可靠地模仿精选演示,为研究工作流和工具使用建立稳定行为基线。然而,仅靠行为克隆往往产生模仿而无探索。RL 与环境闭环,使用奖励信号来改进策略并内化智能体规划与执行。特别是,强化学习(1)通过与环境的主动交互探索最优策略;(2)内化目标导向的规划与执行能力;(3)通过优先考虑高奖励行为实现更优样本效率。智能体首先在监督微调阶段获得通用智能体模式,而强化学习阶段有效推动其智能体性能的极限。

以合成数据为中心的扩展。数据是训练的基础,而收集 DeepResearch 问题的数据极其困难。深度研究问题要求智能体具备连接信息、跨来源推理和验证结论的能力。与自然丰富的预训练数据和相对容易标注的传统 LLM 后训练数据不同,智能体数据本质上稀缺。研究级问题难以从网络自然文本中获得。人工标注这些问题和智能体轨迹极其耗时且昂贵(Wei et al., 2025)。基于上述智能体训练流水线,智能体中程训练需要大规模、多样的轨迹来对齐后续智能体行为,而智能体后训练依赖高质量、可验证的数据来提供可靠奖励信号。因此,很难依靠自然数据来扩展 DeepResearch 能力。因此,我们专注于使用大型语言模型生成合成数据。合成数据相比人工标注具有以下若干优势:

  • 合成研究级问题易于扩展。与人工标注相比,我们可以使用 LLM 高效合成问答对。模式和多样性易于泛化。LLM 易于理解难题结构,并且通常对多样模式具有罕见洞见,而训练标注者理解研究级问题的结构和模式则非常耗时。

  • 合成数据能够实现有针对性的元能力增强。通过将复杂智能体任务分解为基础元能力(例如规划、信息综合、记忆管理),我们可以生成专门针对并强化单个智能体技能的合成数据。

  • 合成数据易于验证。这比寻找问题答案容易得多,而后者在人工标注中至关重要。

  • 合成数据可以在训练阶段提供数据飞轮。经过一轮智能体训练流水线后,训练后的智能体模型可以生成具有更强推理和规划模式的合成数据。数据飞轮使智能体模型迭代演化。

基于这些洞见,我们相信合成智能体数据成为扩展深度研究智能体的关键。智能体训练流水线所有阶段的合成数据均按三个步骤设计:(1)合成研究级问题;(2)生成智能体行为数据;(3)在训练流水线中利用智能体数据。

通过环境交互学习。环境交互在智能体智能涌现中起着关键作用(Silver & Sutton, 2025)。然而,仅依赖真实世界环境进行整个智能体训练阶段面临根本挑战:(1)非平稳性。环境的动态特性导致训练数据持续分布偏移,破坏学习稳定性;(2)交互成本。每次 API 调用的实际费用使大规模探索在经济上不可行。这些障碍使得仅从真实世界获取智能体能力成为一项艰巨任务。

在 Tongyi DeepResearch 中,我们提出一种根本性重构:环境不应被动地被视为外部现实,而应主动设计为与训练过程深度耦合的系统。具体而言,我们将环境建模为三种形式,每种在稳定性、保真度和成本之间取得不同平衡:

  • 先验世界环境。该环境提供任务元素、工具和状态定义,允许智能体基于预训练知识自主挖掘交互轨迹,而无需接收实际环境响应。它提供完美稳定性、零交互成本和无限可扩展性,但缺乏真实世界反馈信号。

  • 模拟环境。该环境在本地构建真实世界交互的受控、可复现副本。它提供稳定性、快速响应和低成本,支持快速迭代和因果归因分析。然而,其数据覆盖本质上有限,表现出显著的模拟到现实差距。

  • 真实世界环境。该环境提供最真实的数据分布和反馈信号,是智能体能力的终极试验场。其优势在于绝对分布保真度;代价是昂贵的交互、显著的非平稳性和探索风险。

基于这一环境洞见,我们在合成数据生成和训练中采用自适应策略。具体而言,(1)在智能体中程训练期间,我们主要利用先验世界环境和模拟环境以最小成本生成大规模合成数据,确保高效智能体能力引导;(2)在智能体后训练期间,我们在模拟环境中验证训练策略和算法技术,然后将验证后的最优策略部署到真实环境进行最终训练。环境的选择至关重要,智能体智能并非来自单一世界,而是来自精心选择的环境。

智能体训练根本上依赖合成数据和环境交互。基于这些设计原则,我们下面详细介绍 Tongyi DeepResearch。

3 Tongyi DeepResearch

3.1 形式化

我们通过三个基本组件正式定义 Tongyi DeepResearch 在每个时间步 t 的展开(rollout):

这种上下文管理范式尤为关键,它不仅防止上下文窒息,还通过要求智能体在每一步显式综合和优先处理信息来强制结构化推理。这一设计自然契合人类研究模式,其中周期性综合和反思对于保持连贯的长期调查至关重要。

3.2 整体训练配方

系统从预训练基础模型 Qwen3-30B-A3B-Base<sup>1</sup> 初始化。Tongyi DeepResearch 通过端到端训练框架开发,该框架整合智能体中程训练和后训练,使复杂研究任务中的可扩展推理和信息检索成为可能。这确立了训练智能体模型的新范式。我们首先在第 3.3 节介绍中程训练过程,然后在第 3.4 节介绍后训练阶段。

图 2:Tongyi DeepResearch 的训练流水线。

3.3 智能体中程训练

3.3.1 训练配置

Tongyi DeepResearch 采用两阶段智能体持续预训练(Agentic Continual Pre-training,Agentic CPT)(Su et al., 2025)作为其核心中程训练阶段。该阶段充当连接预训练模型和智能体后训练的关键桥梁。其主要目标是提供一个具有强智能体行为归纳偏差的基础模型,同时保持广泛的语言能力。为实现这一目标,优化过程由标准下一 token 预测损失函数驱动。

该阶段的设计在效率和渐进能力扩展方面均经过策略性优化。我们首先在第一阶段使用 32K 上下文长度,然后在第二阶段扩展到 128K。这一扩展上下文窗口特别在第二阶段利用,我们引入大量长序列(64K-128K)智能体行为数据。这种方法对于增强模型连贯、长周期推理和行动能力至关重要。在两个阶段中,都穿插少量通用预训练数据,确保模型获得专门智能体能力而不牺牲其基础泛化能力。

3.3.2 大规模智能体行为数据合成

图 3:用于智能体持续预训练的大规模智能体行为数据合成。

在 Agentic CPT 中,我们合成覆盖智能体工作流完整生命周期的数据,如图 3 所示。典型智能体工作流从问题开始,迭代循环进行反思和行动,最终收敛到最终解决方案。为全面捕捉这一过程,我们为构成智能体操作周期的关键步骤合成数据:问题合成、规划动作、推理动作和决策动作。注意,尽管决策在智能体循环中通常是隐式的,我们在合成框架中将其显式建模为一种独特动作类型。

大规模多风格问题合成。基于持续更新的开放世界知识,我们构建实体锚定的开放世界记忆。该记忆将多样真实世界知识源(如网络爬取数据和智能体交互轨迹)整合为实体及其关联知识的结构化表示。在此基础上,我们采样实体及其相关知识,生成嵌入特定行为模式要求的多样问题,例如多跳推理问题和数值计算问题。

规划动作。规划指问题分解和第一步动作预测。一个关键洞见是,规划准确性与智能体能否成功完成任务高度相关。因此,我们采用开源模型分析、分解合成问题并预测初始动作。此外,我们利用问题构建中使用的实体和关联知识作为拒绝采样基础,从而确保高质量规划输出。

推理动作。对异构数据进行逻辑推理和知识整合是智能体解决复杂任务的基础。当外部工具返回大量非结构化响应时,模型能否从噪声中提取关键知识并构建连贯推理路径直接决定任务结果。为此,给定问题及其依赖知识,我们引导大型模型通过两阶段过程生成完整推理链,并采用基于推理长度和答案一致性的双重过滤机制确保质量。

决策动作。智能体思考和行动的每一步本质上都是隐式决策过程。具体而言,每个决策点包含多个潜在推理和行动路径,智能体必须从中选择最有前景的解决方案。为捕捉这一关键机制,我们显式建模这一决策过程。首先,基于现有演示轨迹,我们彻底探索每一步的可行动作空间。其次,我们将原始轨迹重构为多步决策序列,同时保留原始决策选择。

通过环境扩展的通用函数调用数据合成。为增强模型的通用智能体能力,我们通过环境扩展系统性地扩展函数调用数据。函数调用能力的广度与智能体训练环境的多样性密切相关(Fang et al., 2025)。我们还将环境扩展作为推进通用智能体智能的一步。在设计环境构建和扩展时,我们遵循这样的原则:智能体的核心在于其环境交互能力,每个环境实例化为读写数据库。我们设计了一个可扩展框架,自动构建完全模拟的异构环境,系统性地拓宽函数调用场景空间。生成的数据被纳入模型的中程训练阶段。

3.4 智能体后训练

后训练流水线包括三个阶段:数据合成、用于冷启动的监督微调,以及智能体强化学习。

3.4.1 高质量数据合成

图 4:高质量数据合成流水线。

我们开发了端到端合成数据生成解决方案,以生成复杂、高不确定性、超人类水平的问题-答案对(Li et al., 2025cb),如图 4 所示。这一全自动过程无需人工干预即可构建超人类质量数据集,旨在推动智能体性能边界。该过程首先通过随机游走构建高度互联的知识图谱,利用网络搜索获取相关知识,以及来自真实世界网站的同构表格,确保真实信息结构。然后我们采样子图和子表以生成初始问题和答案。关键步骤是策略性地增加问题中的不确定性以提高其难度(Wu et al., 2025a)。这一实用方法基于完整理论框架,我们正式将 QA 难度建模为实体关系上一系列可控“原子操作”(例如合并具有相似属性的实体),允许我们系统性地增加复杂性。为进一步减少组织化信息结构与 QA 推理结构之间的不一致,实现更可控的难度和推理结构扩展,我们提出了基于集合论的信息检索问题形式化建模(Tao et al., 2025)。通过这一形式化,我们开发了以受控方式扩展问题的智能体,最小化推理捷径和结构冗余,从而进一步提高 QA 质量。此外,这种形式化建模还允许高效验证 QA 正确性,有效解决后训练合成信息检索数据验证的挑战。

我们还开发了一个自动化数据引擎,以扩展博士级研究问题的生成(Qiao et al., 2025)。从多学科知识库开始,它创建需要多源推理的种子 QA 对。这些种子经过迭代复杂性升级,其中配备相应工具的问题构建智能体逐步扩展范围和抽象。每次迭代精炼并复合先前输出,实现任务难度的系统性和可控升级。

3.4.2 用于冷启动的监督微调

智能体后训练流水线的初始阶段是监督微调(SFT)阶段,旨在在强化学习之前为base模型配备稳健的初始策略。从我们合成的高质量 QA 数据开始,我们获得覆盖完整思维过程和由高性能开源模型生成的工具响应的训练轨迹,然后对其进行严格拒绝采样协议。这一全面过滤过程确保仅保留展现多样问题解决模式的高质量轨迹。

3.4.3 智能体强化学习

为推进模型在复杂网络环境中实现更稳健可靠的规划和搜索能力,我们应用智能体 RL 框架,如图 5 所示。在该框架中,模型生成完整任务尝试(“rollout”),如果其最终答案与真实答案匹配则获得奖励(RLVR)(Guo et al., 2025)。在整个智能体 RL 过程中,模型持续与环境(模拟或真实世界)交互,每次迭代改进其策略,并反过来使用改进后的策略策划新的更高质量训练数据。

图 5:我们的智能体强化学习框架概览。

真实世界环境。我们智能体的工具包是一个复杂系统,集成若干专门工具²:(1)Search,(2)Visit,(3)Python Interpreter,(4)Google Scholar,(5)File Parser。该系统的端到端可靠性至关重要。外部 API 的固有波动性,包括高延迟、彻底失败和不一致返回,可能污染我们的训练轨迹。这种数据污染使得诊断性能问题几乎不可能,模糊了不良结果是智能体策略弱点还是环境本身不稳定性造成的。为确保智能体训练和评估期间可靠的工具使用,我们开发了统一沙箱。该接口围绕中央调度和管理层构建,编排每次工具调用。对于每个工具,我们实现稳健的并发控制和容错机制,例如主动 QPS 速率约束、结果缓存、自动超时和重试协议、非关键故障的优雅降级,以及无缝故障转移到备份数据源(例如备份搜索 API)。这一设计将工具调用抽象为智能体的确定且稳定接口,从而使训练循环免受真实世界随机性影响,同时显著降低运营成本。这一设计将工具调用抽象为确定性接口,提供稳定快速的体验,这对于防止工具错误污染智能体学习轨迹至关重要。

模拟环境。直接利用真实世界网络环境 API 会带来许多实际问题³。我们首先基于 2024 年维基百科数据库构建离线环境,并开发一套本地 RAG 工具来模拟网络环境。然后我们复用数据合成流水线,专门为此离线环境创建高质量、结构复杂的 QA。这为我们提供了低成本、高效率且完全可控的平台,支持高频快速实验,从而极大加速开发迭代过程。

同策略异步展开框架。智能体展开的迭代性质需要与环境大量交互,形成显著瓶颈,拖慢整个 RL 训练过程。为克服这一问题,我们在 rLLM 框架(Tan et al., 2025)上实现自定义的步骤级异步 RL 训练循环。我们的解决方案利用两个独立的异步在线服务器,一个用于模型推理,另一个用于工具调用。然后中央交互处理器处理两者输出,将反馈格式化为统一消息列表。这种架构允许多个智能体实例并行与环境交互,各自独立完成其展开。

RL 训练算法。我们的 RL 算法是 GRPO(Shao et al., 2024)的定制改编:

我们采用严格同策略方案,轨迹始终使用最新策略采样,确保学习信号始终与模型当前能力相关。奖励是答案正确性的纯 0 或 1 信号。我们不包括格式奖励(例如格式正确性 0.1),因为前面的冷启动阶段确保模型已熟悉所需输出格式。遵循 DAPO(Yu et al., 2025),我们在训练目标中应用 token 级策略梯度损失和 clip-higher 策略以鼓励更多探索。为进一步减少优势估计方差,我们采用留一策略(Chen et al., 2025)。此外,我们在初步实验中观察到,直接在未过滤的负展开集上优化会显著降低训练稳定性,并可能在长时间训练后导致策略崩溃。为缓解这一问题,我们选择性地从损失计算中排除某些负样本,例如那些因超过长度限制而未产生最终答案的样本。这些修改的主要动机不是算法新颖性,而是对更高效稳定训练范式的务实追求。

自动数据策划。我们根据训练动态实时优化数据,通过自我探索泛化到分布外场景。这种优化通过完全自动化的数据过滤流水线实现,该流水线基于改进后的策略模型动态调整训练集。具体而言,我们的过程从大型数据集 D 开始。我们使用初始 SFT 模型作为基线策略,为每个问题采样多个解决方案尝试或展开。然后我们通过过滤掉模型总是失败或总是成功的问题来创建初始训练集 D′,因为这些问题不会为 RL 训练提供学习信号。这留下一个聚焦的中等难度问题子集。在 RL 训练期间,我们通过最新展开持续监控 D′ 中的问题,以查看它们对改进后的策略模型是否变得过于容易。同时,一个独立过程使用策略模型的中间检查点从整个原始数据集 D 中采样。这一后台过程识别并收集对当前更强模型而言已变得中等难度的新问题备份池。当训练达到一定步数或奖励趋于平稳时,我们通过移除已掌握问题并纳入备份池中新的挑战性问题来刷新活动训练集 D′。整个数据过滤和刷新流水线独立运行,从不中断主 RL 训练循环。这一设计允许我们自动演化策略模型及其训练数据,确保始终高训练效率和稳定性。

通过实验,我们得出一个关键洞见:智能体 RL 的成功更多取决于数据质量和训练环境稳定性,而非所使用的具体算法。因此,我们将精力集中在设计稳定环境和策划高质量数据上,仅对算法本身做少数必要修改,主要用于稳定训练过程。

3.4.4 模型合并

我们在流水线最后阶段采用模型合并。这种方法基于一个关键洞见:当不同模型变体源自同一预训练模型时,其参数可以通过平均或插值有效组合(Wang et al., 2025)。具体而言,我们的过程包括选择若干源自同一基础模型但展现不同能力偏好的模型变体。然后我们通过计算其参数的加权平均来创建最终合并模型:

4 实验

4.1 实验设置

骨干模型。我们在七个公开信息检索基准上评估 Tongyi DeepResearch,涵盖长期推理和长周期工具使用。该模型与两类系统比较:1)基于 LLM 的 ReAct 智能体:GLM-4.5(Zeng et al., 2025)、Kimi-K2(Team et al., 2025)、DeepSeek-V3.1(DeepSeek Team, 2025)、Claude-4-Sonnet(anthropic, 2025)、OpenAI o3/o4-mini(OpenAI, 2025b);2)端到端深度研究智能体:OpenAI DeepResearch(OpenAI, 2025a)、Gemini DeepResearch(Gemini Team, 2025)、Kimi Researcher(Kimi, 2025)。

基准。我们遵循每个基准的官方评估协议。基准涵盖:(1)Humanity's Last Exam(Phan et al., 2025);(2)BrowseComp(Wei et al., 2025)和 BrowseComp-ZH(Zhou et al., 2025);(3)GAIA(Mialon et al., 2023);(4)xBench-DeepSearch(Xbench Team, 2025);(5)WebWalkerQA(Wu et al., 2025b);(6)FRAMES(Krishna et al., 2025);(7)xbench-DeepSearch-2510。

所有分数均使用每个基准发布的官方脚本计算。评估细节见附录 B。

评估。我们采用固定推理参数以确保评估的稳定性和可复现性:temperature =0.85,repetition penalty =1.1,top-p =0.95。每个任务最多允许 128 次工具调用,上下文长度限制为 128K token。每个基准独立评估三次,我们报告平均性能(Avg@3)作为主要指标。为完整起见,我们还在后续分析中报告最佳 Pass@1(3 次运行中的最佳结果)和 Pass@3 结果。所有结果均于 2025 年 9 月 16 日获得,xbench-DeepSearch-2510 除外,其评估于 2025 年 10 月 28 日进行。

复现。Tongyi DeepResearch 使用包含 Search、Visit、Python、Scholar 和 File Parser 工具的动作空间运行。我们在 GitHub 上发布官方复现脚本,以及完整工具实现和提示配置。

4.2 主要结果

表 1 展示了 Tongyi DeepResearch 与广泛最先进 LLM 智能体和专有深度研究系统在多个基准上的性能比较,包括 Humanity's Last Exam、BrowseComp、BrowseComp-ZH、GAIA、xbench DeepSearch、WebWalker QA 和 FRAMES。Tongyi DeepResearch 在几乎所有评估基准上取得最高分,展现出在英语和中文任务上的强泛化能力。它持续超越开放和闭源商业系统,包括 OpenAI o3、DeepSeek-V3.1 和 Gemini DeepResearch。在新发布的 xbench-DeepSearch-2510 上,Tongyi DeepResearch 仅次于 ChatGPT-5-Pro,展现出在该领域前沿的竞争力。值得注意的是,这些收益仅以每个 token 激活 33 亿参数实现,凸显了模型的效率和可扩展性。总体而言,Tongyi DeepResearch 在开源深度研究智能体中确立了新的最先进水平,缩小并在某些情况下甚至超越了前沿专有系统的性能,同时保持卓越可解释性和计算效率。

表 1:各基准上的性能比较。

基准Humanity's Last ExamBrowseCompBrowseComp-ZHGAIAxbench DeepSearchWebWalker QAFRAMES
基于 LLM 的 ReAct 智能体
GLM 4.521.226.437.566.070.065.678.9
Kimi K218.114.128.857.750.063.072.0
DeepSeek-V3.129.830.049.263.171.061.283.7
Claude-4-Sonnet20.312.229.168.365.061.780.7
OpenAI o324.949.758.1-67.071.784.0
OpenAI o4-mini17.728.3-60.0---
DeepResearch 智能体
OpenAI DeepResearch26.651.542.967.4---
Gemini DeepResearch26.9------
Kimi Researcher26.9---69.0-78.8
Tongyi DeepResearch (30B-A3B)32.943.446.770.975.072.290.6

4.3 Heavy 模式

图 6:Tongyi DeepResearch Heavy 模式与最先进模型的性能比较。

为进一步释放深度研究智能体潜力,我们引入 Heavy 模式,它利用基于上下文管理范式(Chen et al., 2026)的 Research-Synthesis 框架进行测试时扩展。鉴于 DeepResearch 涉及多轮工具调用和密集推理,直接聚合多个轨迹的上下文在计算上不可行。我们的 Heavy 模式通过策略性并行化和综合来解决这一挑战。

如图 6 所示,我们的 Heavy 模式在 Humanity's Last Exam(38.3%)和 BrowseComp-ZH(58.1%)上取得最先进性能,同时在 BrowseComp(58.3%)上保持高度竞争力。这些显著改进验证了我们基于上下文管理的 Heavy 模式通过并行探索和智能聚合利用测试时计算的有效性。

4.4 详细分析

Pass@1 和 Pass@3 性能。我们在表 1 中报告 Avg@3 性能。鉴于智能体环境的动态复杂性,我们进一步对 Pass@1(三次运行中最佳)和 Pass@3 进行细粒度分析,如图 7 所示。尽管评估环境不稳定,我们的最终 Avg@3 结果与 Pass@1(三次运行中最佳结果)结果一致,证明了深度研究方法的稳健性。我们的 Pass@3 性能展示了智能体的强大潜力。特别是,它在 BrowseComp 上达到 59.64,在 BrowseComp-ZH 上达到 63.67,在 Humanity's Last Exam 上达到 45.9。

图 7:使用 Avg@3、Pass@1 和 Pass@3 指标的详细评估结果。

训练奖励和熵。如图 8 所示,智能体性能随训练呈现清晰显著的上升趋势,确认了有效的策略学习。这种改进的持续性凸显了我们动态数据策划的成功,它通过持续提供挑战性材料防止学习停滞。同时,策略熵表现出非凡稳定性,在最初短暂上升后收敛到一致值,从而避免崩溃和爆炸。这一结果强有力证明了我们在环境设计和算法修改方面的方法论贡献,它们共同为显著稳定有效的 RL 训练范式创造了必要条件。

RL 的上下文长度。在图 10 中,我们分析模型上下文长度对智能体 RL 训练过程的影响,比较 32k、48k 和 64k 上下文限制的模型。需要注意的是,所有三个实验变体的动态数据策划均使用相同 64k 上下文模型进行。首先关注左图的奖励动态,我们观察到所有三个模型都展现出有效且稳定的策略学习,表现为奖励单调增加。这确认了我们训练框架的稳健性。然而,它们的性能上限显著分化,这是我们数据策划方法的预期结果。由于课程由高度 capable 的 64k 上下文模型认为中等难度的问题填充,许多问题本质上需要长而复杂的推理才能解决。因此,清晰层级出现:64k 模型与其自身数据完美匹配,获得最高奖励。48k 和 32k 模型因受越来越大约束,无法解决课程中最复杂问题,从而限制其最大潜在奖励。

右图的训练动态揭示了一个更有趣的故事。64k 上下文模型表现出平均响应长度稳步增加,学会利用其扩展上下文构建更精细解决方案。相反,48k 上下文模型保持稳定平衡,在稳定复杂度预算内改进策略。最令人惊讶的是,32k 上下文模型表现出响应长度明显下降趋势。这一观察提供了关键洞见:对于上下文有限的模型,在专为更强模型设计的课程上进行 RL 训练可以迫使其发现更高效解决方案。这种效应出现是因为我们的动态数据课程使用 64k 上下文模型持续更新,这一过程用最优解决方案可能超过 32k token 的问题填充训练集。对于 32k 上下文模型,尝试这些问题可能产生零奖励信号。这产生强大的隐式激励,促使其发现更简洁、有效的动作序列以适应其限制,从而随时间变得更高效。

图 9:RL 训练不同上下文长度限制的比较。

交互测试时扩展。与传统模型不同,DeepResearch 智能体主要依赖与环境交互来获取信息并完成任务。因此,与环境交互轮数至关重要。虽然推理模型可以通过增加输出 token 数扩展,我们的方法沿不同维度扩展——环境交互次数。自然,随着交互次数增加,智能体从环境获得更多观察,导致上下文更长。图 10a 展示了我们的扩展曲线:随着上下文长度和交互次数增长,模型在 BrowseComp 数据集上的性能持续提升。

图 10:交互扩展和模拟环境的详细分析。

超人类水平合成数据。为验证合成数据有效性,我们对 SFT 数据集进行统计分析。超过 20%20% 的样本超过 32k token,涉及超过 10 次工具调用。这展示了我们合成数据的高复杂性和丰富性。如此高质量的冷启动数据为模型提供深度推理和研究能力的强大基础,为 RL 阶段提供优秀初始化。在强化学习期间,我们利用自动数据策划更有效利用合成数据。

从模拟到现实。为快速验证算法,我们构建了镜像真实世界条件的模拟 Wiki 环境。我们在此环境中测试改编的 GRPO 算法,所得奖励曲线如图 10b 所示,与图 8 中真实环境观察到的曲线密切匹配。这一 Wiki 模拟环境提供了类似于“风洞实验室”的功能,支持快速算法迭代,显著提高开发效率。

通用基准性能。我们评估三个通用基准:AIME25、HMMT25 和 SimpleQA(OpenAI, 2025c)。结果如图 11 所示。实验结果表明,Tongyi DeepResearch 相比仅依赖推理而无工具使用的基础模型取得显著改进。一方面,系统可以通过搜索检索外部信息,这对知识密集型基准特别有效;另一方面,Python Interpreter 使其能够通过原生计算支持增强数学推理任务性能。展望未来,模型训练与智能体训练日益趋同,解决范式朝向整合工具调用和环境交互的智能体架构演进,反映更类人的问题解决过程。

图 11:通用基准上的性能。

5 讨论

5.1 局限性

我们承认当前工作存在若干局限:第一,当前 128K 上下文长度仍不足以处理最复杂的长周期任务,促使进一步探索扩展上下文窗口或更高级上下文管理机制(Qiao et al., 2025; Wu et al., 2025c)。第二,我们尚未发布更大规模模型。尽管较小规模模型已展现强性能,更大模型目前正在进行中。第三,我们持续改进报告生成保真度并优化用户偏好,以确保更忠实、有用且偏好对齐的输出(Li et al., 2025e)。第四,我们旨在通过探索部分展开等技术提高强化学习框架效率,这将需要解决离策略训练挑战,包括分布偏移。最后,我们当前 Deep Research 训练聚焦特定提示指令和预定义工具集。我们计划增强其稳健性,并将框架从 Deep Research 扩展到更广泛的智能体工具使用场景。

5.2 模型规模

我们相信在相对较小模型上训练智能体能力极具价值(Belcak et al., 2025)。较小模型本质上更易于部署在边缘设备上,拓宽跨多样真实世界场景的可及性,并提供更快、更响应的交互。这一方向与使自主研究智能体既强大又实际可部署的更广泛目标一致。

5.3 下一步

我们长期致力于推进深度研究智能体的研发。Tongyi DeepResearch 代表了朝向能够自主将信息转化为洞见的 AI 系统的重要一步。我们倡导具有涌现能动性的开源模型,这对于民主化智能体智能和深化我们对能动性如何在开放系统中涌现和扩展的基本理解至关重要。展望未来,我们旨在从领域特定智能体演进到通用智能体,能够在多样领域中以最少人类监督自主推理、规划和行动。为实现这一目标,我们正在开发下一代智能体基础模型,一种统一模型,旨在赋予 AI 系统可扩展推理、记忆和自主性,使其能够作为真正通用智能体运行。我们相信它将赋能个人和组织达到生产力和创新的新高度。

6 结论

我们介绍了 Tongyi DeepResearch,一个开源深度研究智能体,将智能体中程训练和后训练统一为可扩展的端到端范式。通过自动化数据合成和阶段特定环境,模型学会自主规划、搜索、推理和综合信息。尽管其效率高,仅激活 3.3B 参数,Tongyi DeepResearch 在多个深度研究基准上取得最先进结果,超越强专有系统。这项工作为自主 AI 智能体的开放、可复现研究奠定了基础,并标志着朝向更通用、自我改进智能的一步。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询