TensorX

TensorX · Paper Blog

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment

Xinyu Geng, Xuanhua He, Sixiang Chen, Yanjing Xiao, Fan Zhang, Shijue Huang, Haitao Mi, Zhenwen Liang, Tianqing Fang, Yi R. Fung (HKUST & Tencent) · 2026-07-13

Deep SearchSelf-DistillationReActAgentVerifiable Environment

本文提出 DeepSearch-World 确定性可验证环境与 DeepSearch-Evolve 自蒸馏框架,通过实体级随机游走构造 420K 多跳 QA 任务,在无需更强闭源模型蒸馏的前提下实现 Agent 自我演化。

💡 核心创新点

让大语言模型(LLM)智能体在复杂多步工具使用中自我演化(Self-Evolving)一直面临巨大的训练难题。传统的**监督微调(SFT)高度依赖从更强超大闭源模型(如 GPT-4 或 OpenAI Deep Research)蒸馏出的静态轨迹,这不仅成本高昂,且智能体性能很快会在几步优化后陷入饱和。而基于强化学习(RL)**的方法(如 GRPO)则受制于极度稀疏的轨迹级最终结果奖励,无法为智能体在中间步骤(如查询语句改写、页面内容检索、证据交叉比对)中的成败提供确定性的过程级指导。

为了破解这一难题,来自香港科技大学与腾讯的研究团队提出了全新的智能体自我演化范式,其核心突破体现在三大维度:

图1:自演化范式对比

智能体自我演化的三代范式跃迁

  1. 确定性且可验证的离线环境 DeepSearch-World:研究团队打破了对动态生硬联网环境的依赖,利用包含约 **1000 万实体(10M entities)的离线维基百科全量语料,构建了高度可重复且能进行实体级验证的离线深搜环境。环境能够自动识别智能体中间提取到的目标实体,提供过程级验证信号(Process-level Supervision)**与接地反思(Grounded Reflection)。
  2. 脚手架至 ReAct 的过程蒸馏机制(Scaffold-to-ReAct Conversion):训练过程中,教师策略在带有显式规划、工作内存跟踪(Working Memory)与恢复反思的脚手架(Scaffold)下生成高质量轨迹,随后将其优雅平滑地转译为标准 ReAct 格式,将深层认知行为“内化”为学生的思维链。
  3. 脱离超大闭源模型的纯自主演化闭环(DeepSearch-Evolve):智能体完全依赖自身 Rollout 产生的验证体验,结合拒绝采样与轨迹质量过滤(Quality Filtering)进行多轮演化 SFT。不依赖任何外部强模型数据,仅凭 9B 规模 基座模型即实现了超越众多强闭源智能体的表现。

🎯 核心结论:DeepSearch-Evolve 证明了在具象可验证的环境中,9B 规模的开源模型无需蒸馏 GPT-4,仅依靠自我经验与可控过程级自蒸馏,就能建立强大的长航程深度搜索能力。

🔍 背景与动机

在现有的工具使用 Agent 研究中,要让智能体掌握长航程(Long-horizon)信息搜寻能力,开发者通常会遇到一个无法回避的尴尬对立:静态模仿 vs. 动态探索。

如果采用传统的基于模仿的 SFT,智能体只能全盘接收给定的正向轨迹。这种方法在初期效果明显,但由于缺乏对抗错误的机制,一旦智能体在真实执行中走入死胡同或遇到搜寻无果的边缘情况,就会瞬间丧失自我纠错能力,产生严重的幻想或死循环。更严重的是,智能体的表现上限被蒸馏教师的能力强行封顶。

另一方面,如果转向基于奖励的强化学习(RL),系统通常只在 Agent 最终提交答案时返回一个标量 0 或 1。然而一个复杂的 Deep Search 任务往往包含数十轮工具交互,包括“生成查询 \rightarrow 读取摘要 \rightarrow 访问网页 \rightarrow 发现矛盾 \rightarrow 重新调整搜索策略 \rightarrow 提取关键证据”。在这种超长链路中,最终的失败可能源自最初的检索关键词偏差,也可能源自中途的证据提取遗漏。稀疏的终点奖励根本无法为中间的认知步骤归因,导致探索效率低下,工具行为出现随机漂移。

为了形象地理解这一痛点,不妨用一个侦探搜寻线索的生活化比喻:

假想我们在训练一名实习侦探。如果只是在破案后告诉他“抓对人了”或“抓错人了”(稀疏 RL 奖励),侦探很难搞清楚自己究竟是哪一步搜查令申请错了,还是哪一条遗留线索没注意到;而如果我们只让他照抄老侦探的完美卷宗(静态 SFT),他在面对全新现场遇到死胡同时就会束手无策。真正的训练需要一个虚拟案发现场沙盘——侦探每找到一块关键证据,沙盘就会客观亮起绿灯;当他搜查无效时,沙盘会提示“该线索不存在,请重新审视线索关联”。

DeepSearch-World 正是这样一个高仿真的确定性“沙盘”。它为长航程智能体提供了可追溯、可验证的过程引导,使在线蒸馏能够稳定精准地作用于每一个中间动作。

📊 数据集与实验环境

为了支撑大规模自蒸馏演化,研究团队设计了一套高度可扩展的数据生成机制与离线交互环境。

420K 维基百科知识图谱数据生成

研究团队首先基于维基百科的超链接图谱(Wikipedia Hyperlink Graph)构建知识树。通过在图谱上执行实体级随机游走(Random Walk,步长设置为 HH),构建包含多步推理逻辑链条的生成路径。随后利用 Gemini-3-Pro 将这些路径转化为 420,000 个多跳 QA 任务

为了防止模型记忆实体名称并强迫其展开真正的多跳搜索,团队引入了**特征模糊化(Feature Fuzzification)**技术:将问题中的显式实体替换为近似描述(例如将“2014 年”模糊化为“2010 年代”,将“北京”模糊化为“中国某大型城市”)。这要求 Agent 必须使用工具检索并比对详细事实,而无法依靠内生记忆直接猜出答案。

DeepSearch 数据生成 pipeline:
种子维基文章 --> 广度优先探索(BFS) --> 构造知识树
             --> 抽取子图 (2-4 subtrees) --> 生成多跳复杂问题
             --> 特征模糊化 (Feature Fuzzification) --> 420K 训练任务池

离线环境与软件超参配置

研究团队将包含约 1000 万实体(10M entries) 的维基百科全量文本构建为离线数据库。环境提供两款标准离线工具:

  • web_search_wiki:内置 基于 Pyserini 的 Lucene BM25 检索索引,检索返回候选页面的标题、摘要与伪 URL;
  • visit_wiki:通过 SQLite 偏置索引检索 JSONL 全文,实现毫秒级页面访问与内容读取。

同时团队保留了包含 377 个高质量复杂任务 的保留验证集 DeepSearch-Val,由 5 人专家池独立交叉验证,确保评估结果绝对可靠。

实验的具体硬件平台与演化训练超参数如下:

  • 硬件环境:单节点 8 张 NVIDIA H20 GPU(支持 vLLM 异步推理,TP=4 或 TP=8);
  • 训练框架:基于 Llama Factory,采用 DeepSpeed ZeRO-2 优化器,BFloat16 混合精度;
  • 演化轮数与规模:自演化循环进行 R=11R = 11;每轮随机采样 10,000 个问题 进行 Rollout,经过拒绝采样与质量过滤后保留约 4,000 条顶级轨迹 触发 SFT;
  • 训练超参:学习率设置为 5×1065 \times 10^{-6},采用 Cosine 学习率衰减,10% Warmup,最大序列长度 32,768
  • 交互参数:最大交互步数上限 Tmax=30T_{\max} = 30,滑动上下文窗口大小 w=3w = 3,页面截断阈值 8,192 字符

🛠️ 核心机制与研究方法

DeepSearch-Evolve 的架构由环境层、教师脚手架层、转译层以及迭代自蒸馏训练闭环组成。

图2:DeepSearch-World 与 DeepSearch-Evolve 整体架构

离线确定性环境与确定性验证

为了在不消耗昂贵 LLM Judge 的前提下评估智能体每一步的真实进展,DeepSearch-World 为每个问题存储了一个无序的目标实体集合 Ti={ei,1,,ei,H}T_i = \{e_{i,1}, \dots, e_{i,H}\}。在交互过程中,环境维护已完成实体集合 StTiS_t \subseteq T_i

当智能体执行工具调用 ata_t 并获取观察 oto_t 时,环境会自动扫描文本。如果成功匹配到未解答实体 TiStT_i \setminus S_t,则将其归入 St+1S_{t+1}。如果工具调用未命中任何目标(例如搜索关键词偏差或页面不存在),环境会自动触发**接地反思(Grounded Reflection)**信号 rtr_t,提醒 Agent 缺失的实体特征或规范名称。

环境的状态更新过程可抽象为:

st+1=U(st,at,ot,rt)s_{t+1} = \mathcal{U}(s_t, a_t, o_t, r_t)

这里 sts_t 为当前时刻的结构化状态,包含完成列表与待办列表;ata_t 为动作;oto_t 为工具返回观察;rtr_t 为环境生成的接地反思反馈信号。

脚手架 Teacher 与动态工作内存

为了生成高质量的长航程轨迹,研究团队设计了一个带有三阶段脚手架(Scaffolded Teacher Agent)的教师模型。教师模型在运行过程中显式维持一个包含四个字段的动态工作内存(Working Memory)

  • completed_list:已确认的目标与子事实;
  • todo_list:动态更新的步骤清单,随搜索结果实时增删与重排;
  • experience:从失败尝试中总结的注意事项(例如“某关键词无结果,改用人名重试”);
  • information:从网页中提取的关键事实片段。

图3:三阶段脚手架 Teacher Rollout 示意图

教师的执行分为三大阶段:

  1. Plan 阶段:解析初始问题,初始化结构化状态 s0s_0 与 Working Memory;
  2. Act 阶段:交替进行 <think> 思考、工具调用(web_search_wiki / visit_wiki)、接收环境 Observation 与接地反思 rtr_t,随后调用状态更新模块更新 Working Memory;
  3. End 阶段:当关键证据收集完毕或步骤用尽时,从工作内存生成最终简明答案。

图4:Teacher Agent 生成的典型工具调用轨迹与 Working Memory 更新

轨迹转译:脚手架至 ReAct 的无缝内化

虽然脚手架 Teacher 能够产生极高逻辑质量的轨迹,但如果直接用带有多轮结构化 JSON Prompt 的数据微调学生模型,会导致学生模型过分依赖复杂的外部提示词,失去作为一个独立部署的 ReAct Agent 的通用性。

为此,DeepSearch-Evolve 引入了脚手架至 ReAct 转译技术(Scaffold-to-ReAct Conversion)。在每一个工具调用步骤 tt,转译器将外部脚手架提示与环境反思信号抹去,并将它们重写融入到标准 ReAct 的 <think> 思考块中:

<think>t=PtRtAt\text{<think>}_t = P_t \oplus R_t \oplus A_t

在公式 (2) 中:

  • PtP_t 表示将当前状态 sts_t 重写为关于已完成子目标、待办事项和已知事实的自然语言总结;
  • RtR_t 表示将环境反思 rtr_t 转化为智能体的**自我纠错(Self-Correction)**思维逻辑;
  • AtA_t 保留对当前工具动作 ata_t 的局部合理性推导。

这种转译机制巧妙地将外部脚手架注入的规划与抗挫能力,转化为学生模型内部的隐式推理思维链。

演化 SFT 损失函数的数学本质

完成转译后,系统对轨迹进行过滤。首先通过答案正确性筛选(Rejection Sampling),再经过质量过滤器(Quality Filtering)剔除推理冗余或证据弱关联的样本,得到高质量训练集 D(R)\mathcal{D}^{(R)}

学生模型使用硬标签 Token 级交叉熵损失进行演化 SFT(Evolving SFT):

LSFT(θ)=Eτ~D(R)t=1TKL(δytπθ(x,y<t))\mathcal{L}_{\text{SFT}}(\theta) = \mathbb{E}_{\tilde{\tau} \sim \mathcal{D}^{(R)}} \sum_{t=1}^T \text{KL}(\delta_{y_t} \parallel \pi_{\theta}(\cdot \mid x, y_{<t}))

在公式 (3) 中,τ~=(x,y1:T)\tilde{\tau} = (x, y_{1:T}) 为转译后的验证轨迹,δyt\delta_{y_t} 为目标 Token 的 Dirac 分布,πθ\pi_{\theta} 为待优化的学生策略。

作为对比,完全在线软目标蒸馏(OPSD)的损失函数可以写作:

LOPSD(θ)=Ex,y^<tπθtKL(qtπθt)\mathcal{L}_{\text{OPSD}}(\theta) = \mathbb{E}_{x, \hat{y}_{<t} \sim \pi_{\theta}} \sum_t \text{KL}(q_t \parallel \pi_{\theta}^t)

在公式 (4) 中,qtq_t 表示教师模型在学生产生的 Prefix 下的软概率分布。由于在超长航程工具使用中,学生偏离轨迹后教师产生的软分布极易混入噪声,因此演化 SFT 采用公式 (3) 这种基于环境严格可验证 Prefix 的自蒸馏目标,展现出了显著更优的稳定性和收敛速度。

📈 结果与深度分析

研究团队在 6 项权威深度搜索与复杂推理评测基准上对 DeepSearch-World-9B 进行了全面评估。基座模型选用 Qwen3.5-9B-Instruct

表1:深度搜索与推理评测集主实验对比

全面评测:开源 9B Agent 的性能跨越

如表 1 所示,在完全不依赖任何闭源强模型(如 GPT-4)数据蒸馏的前提下,DeepSearch-World-9B 取得了极其亮眼的表现:

  • 在极具挑战性的 BrowseComp 浏览基准上,成绩从基座模型的 7.4% 飙升至 31.2%(净提升 +23.8 pp),大幅超越了开源标杆 WebSailor(6.7%)、Marco-DR(31.4%)和 MiroThinker-v1.0(31.1%);
  • 在中文深搜基准 BrowseComp-ZH 上达到 36.4%+22.9 pp);
  • 在前沿学术推理集 HLE 上达到 25.7%+9.0 pp),甚至超越了 OpenAI-o3(20.2%);
  • 在复杂任务基准 GAIA 上大幅提升至 61.5%+37.6 pp);
  • xbenchHotpotQA 上分别达到 49.0%+29.0 pp)与 93.4%+48.1 pp)。

🚀 重大突破:仅需 9B 参数规模,通过可验证离线环境中的自蒸馏演化,模型在 GAIA 与 HotpotQA 等高难度长航程推理任务上展现出了媲美 OpenAI Deep Research 等顶级商业系统的实力。

关键消融与长航程行为分析

为了解构 DeepSearch-Evolve 的成功因素,研究团队开展了一系列深度的消融实验。

图5:自蒸馏训练中数据池规模效应分析

1. 数据池规模效应分析

如图 5 所示,团队对比了 420K 任务池100K 任务池 在 11 轮演化中的表现。100K 小任务池在前几轮表现良好,但随后快速饱和并陷入波动,原因在于重复曝光导致模型对特定交互模式过拟合;而 420K 大任务池提供了极高的多样性,使验证得分平稳爬升至更高平台,且格式错误率显著降低,实体命中率持续稳定增长。

图6:DeepSearch-World-9B 的工具调用行为与高级能力分析

2. 智能体工具调用行为重塑

如图 6 所示,经过演化微调后,DeepSearch-World-9B 的交互行为发生了质的改变:

  • 平均交互轮数:从基座模型的仅 4.7 轮增加到 18.0 轮,展现出极强的耐力与长航程搜寻意愿;
  • 深入阅读比率visit_wiki 的平均调用次数从 0.9 次大幅提升至 5.4 次,表明智能体学会了从摘要深入到全文提取确凿证据,而非盲目回答;
  • 高级能力得分(LLM Judge 综合评估):在规划、内存维护、自纠错与证据采集等 5 个维度上的综合得分从 19% 骤升至 70%

表2:拒绝采样与轨迹质量过滤的消融实验

3. 数据过滤与转译策略消融

表 2 与表 3 对拒绝采样(RS)、质量过滤(QF)以及脚手架转译策略进行了剥离验证:

  • 拒绝采样与质量过滤:在 SearchQA 评测中,仅使用答案正确性筛选(RS only)得分为 54.9%,加入轨迹质量过滤(RS + QF)后进一步提升至 58.2%,显著优于 OPSD(49.0%)与 Skill-SD(47.8%);

表3:脚手架轨迹转换为 ReAct 训练数据的消融实验

  • 转译策略的必要性:如表 3 所示,完整 Pipeline 在 DeepSearch-Val 上达到 31.9%;若移除状态内化(w/o state internalization),得分降至 23.5%;若移除反思重写(w/o reflection rewriting),得分大幅跌落至 16.7%。这证明了将裸反思文本中的特殊 Token 改写为自主 Self-Correction 思维对于防止训练漂移至关重要。

⚠️ 局限性与未来展望:作者在文中明确指出,当前环境基于离线维基百科全量文本构建,知识域与真实互联网相比仍有局限,且跨语言迁移能力有待增强;此外,当前框架主要基于自蒸馏 SFT,未来将进一步探索将过程级可验证信号融入在线 RL PPO/GRPO 训练的全新路线。

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号