【COLM 2025】Search-R1:强化学习让大模型学会边推理边搜索|从LLM检索增强推理视角

摘要

本文解读 COLM 2025 论文《Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning》。该论文提出 Search-R1 强化学习框架,通过融合搜索引擎环境建模检索 token 损失掩码纯结果奖励,让大语言模型在推理过程中自主发起多轮搜索、整合实时信息,其特别之处在于不需要任何人工标注轨迹或过程监督。实验表明 7B 与 3B 模型相对 RAG 基线平均提升 24% 与 20%,在七个问答数据集(含 5 个域外数据集)上一致领先,为检索增强推理(RAG 之后的下一代范式)提供了重要借鉴。

视频讲解点击观看 B 站视频

论文基本信息

项目内容
标题(英文)Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
标题(中文)Search-R1:强化学习让大模型学会边推理边搜索
作者Bowen Jin, Hansi Zeng, Zhenrui Yue, Jinsung Yoon, Sercan Ö. Arık, Dong Wang, Hamed Zamani, Jiawei Han
机构University of Illinois Urbana-Champaign / University of Massachusetts Amherst / Google Cloud AI Research
会议COLM 2025
arXivhttps://arxiv.org/abs/2503.09516
项目网站https://github.com/PeterGriffinJin/Search-R1

Search-R1 要解决什么问题:为什么大模型需要学会搜索?

大语言模型(LLM)虽然展现出强大的推理与生成能力,但缺乏实时与领域外的知识,容易产生幻觉;而复杂推理任务往往需要最新的外部信息。把搜索引擎接入 LLM 的已有方案主要有两条路线,各有明显局限:

  • RAG(检索增强生成):按输入查询检索一次、拼接进上下文生成一次。代表工作 Lewis et al.(NeurIPS 2020)。局限:面对多跳问题检索不精准,无法根据推理过程动态调整查询。
  • 搜索即工具:ReAct、IRCoT 用提示词引导迭代"推理—检索",泛化性差;Toolformer 用大规模监督微调学习调用工具,依赖高质量标注轨迹,且搜索操作不可微,无法端到端梯度优化。
  • 推理强化学习路线(DeepSeek-R1 范式):纯结果奖励即可涌现推理能力,但此前没有工作把 RL 应用到"LLM 调用搜索引擎"这个场景——这正是 Search-R1 的切入点。

一句话:已有方法靠"提示"或"标注"教模型搜索,Search-R1 让模型在强化学习中自己学会何时搜索、搜什么、怎么用结果。

研究主线:从问题到结论

Search-R1 研究主线流程图:从问题到结论的五阶段推进(Mermaid 流程图)

图 9:研究主线 Mermaid 流程图——问题 → 动机 → 设计 → 方法 → 实验 → 结论,边标签带关键证据(+24%/+20%)。

基准/方法设计:把搜索引擎变成强化学习环境

Search-R1 的核心设计是把搜索引擎建模为 RL 环境的一部分。经典 RL 目标假定响应轨迹 $y$ 全部由策略模型生成;Search-R1 将其扩展为模型生成与检索结果交织的联合分布:$y \sim \pi_\theta(\cdot \mid x; \mathcal{R}) = \pi_\theta(\cdot \mid x) \otimes \mathcal{R}$,其中 $\mathcal{R}$ 为搜索引擎,$\otimes$ 表示检索与推理的交替。轨迹中检索出的内容只是上下文,不是学习对象。

Search-R1 训练框架:LLM 与搜索引擎在 rollout 中多轮交互

图 1:Search-R1 的 PPO / GRPO 训练流程——模型在 rollout 中生成思考与搜索请求,系统查询搜索引擎并把结果包回上下文,多轮迭代直至给出答案。

框架兼容 PPO 与 GRPO 两种策略梯度算法,两者的目标函数都用有效 token 数归一化。完整公式化见附录 A:PPO 采用广义优势估计(GAE),GRPO 用组内相对奖励计算优势且 KL 惩罚直接加入损失,均通过检索 token 掩码 $I(y_t)$ 保证训练稳定——$I(y_t)=1$ 表示该 token 由模型生成并参与优化,$I(y_t)=0$ 表示检索 token 不参与梯度与 KL 计算。

分类全景:搜索增强推理的两条技术路线

搜索增强推理技术路线分类图:RAG/提示驱动/监督微调/推理交织/RL 优化(Mermaid 流程图)

图 10:搜索增强推理分类全景(Mermaid 流程图)——五条技术路线:RAG 单轮拼接、IRCoT/ReAct 提示驱动、Toolformer 监督微调、Search-o1 推理交织、Search-R1 RL 优化。

方法细节:掩码、结构化 token 与纯结果奖励

四个核心设计要素:

  1. 检索 token 损失掩码:PPO / GRPO 的 token 级损失只对 LLM 生成的 token 计算,检索文本排除在优化之外,避免"检索内容主导梯度"导致的训练不稳定(消融:掩码带来 Avg 0.431 vs 0.343 的提升)。
  2. 结构化特殊 token<think> 推理、<search> 查询、<information> 检索结果、<answer> 答案四类标记,让多轮交互可稳定解析与拼接。
  3. 极简系统提示词:只约束输出结构(先思考、需要时搜索、最后给答案),不注入"必须搜索 / 必须反思"等内容偏向,保留模型自然学习动态。
  4. 纯结果奖励:$r_\phi(x,y) = \text{EM}(a_{\text{pred}}, a_{\text{gold}})$,即最终答案与标准答案的精确匹配(EM),没有格式奖励、没有过程奖励、没有神经奖励模型

Rollout 流程:模型生成遇到 </search> 即触发检索,系统解析查询、调用搜索引擎、把结果以 <information> 包回序列;遇 </answer> 或动作预算 $B=4$ 耗尽则终止。实验证明,仅凭这一机制模型就能涌现"验证式检索"(案例研究中模型在集齐答案后仍额外搜索一轮核验结论)。

实验设计与结果:七个数据集的一致领先

评测协议:通用 QA(NQ、TriviaQA、PopQA)与多跳 QA(HotpotQA、2WikiMultiHopQA、Musique、Bamboogle)共 7 个数据集;训练集 = NQ + HotpotQA 训练集合并;检索统一 E5 编码器 + 2018 Wikipedia 语料,top-3 段落;指标为 EM;基线含 RAG、IRCoT、Search-o1、SFT、无搜索的 R1、拒绝采样等,所有方法共享同一检索器、语料、训练数据与预训练模型。训练在单节点 8 张 H100 上完成 500 步,batch 512,策略学习率 $10^{-6}$。

主表(Qwen2.5-7B,EM)

方法NQTriviaQAHotpotQAAvg
RAG0.3490.5850.2990.304
R1-base(无搜索 RL)0.2970.5390.2420.276
Rejection Sampling0.3600.5920.3310.348
Search-R1-base0.4800.6380.4330.431
Search-R1-instruct0.3930.6100.3700.385

Search-R1-base 平均 0.431,相对 RAG(0.304)提升 24%,相对无搜索 R1(0.276)提升 56%;Search-R1-instruct 平均 0.385 同样高于全部基线。3B 模型相对 RAG 平均提升 20%(0.325 vs 0.270)。

响应长度训练动态:先降后升

图 2:响应长度训练动态——前 100 步骤降(模型去掉冗余填充),随后随搜索调用增加而上升,与训练奖励走势一致。

有效搜索次数训练动态:单调上升

图 3:有效搜索次数随训练单调增加——RL 教会模型判断"何时需要外部信息"。

消融与扩展实验(并入附录结论)

检索 token 损失掩码消融

图 4:损失掩码消融(7b-base)——带掩码训练持续优于无掩码(Avg 0.431 vs 0.343)。

PPO vs GRPO 训练动态

图 5:PPO 与 GRPO 对比——GRPO 收敛快但长训练后奖励坍塌,PPO 更稳定,最终收益相当(默认选 PPO)。

Base vs Instruct 训练动态

图 6:Base 与 Instruct 对比——instruct 收敛快、起点高,RL 可拉平差距,最终奖励趋同。

Top-k 检索段落数研究

图 7:top-k 研究——top-k=3 最优(Avg 0.431);top-k=1 召回不足,top-k=5 噪声拖累。

GRPO 组大小研究

图 8:GRPO 组大小——size=1(等价 REINFORCE)训练最稳、域外泛化最好(Avg 0.410),收敛速度与稳定性存在权衡。

14B 扩展:Search-R1-base 在 Qwen2.5-14B 上 Avg 达 0.479(vs RAG 0.281,相对提升约 70%),超过 7B 的 0.431——规模红利在搜索推理场景同样成立。

结果对比总结

Search-R1 结果对比总结:RAG 0.304 到 Search-R1 0.431 的提升路径(Mermaid 流程图)

图 11:结果对比总结(Mermaid 流程图)——RAG 0.304 → Search-R1-base 0.431(+24%),3B +20% / 14B +70%。

关键发现

  • 系统性超越强基线:7B 模型 7 数据集平均 EM 0.431,相对 RAG 提升 24%,相对无搜索 R1 提升 56%,域内(NQ、HotpotQA)与 5 个域外数据集全部领先。
  • 纯结果奖励即可:EM 匹配奖励 + 检索 token 掩码,无格式奖励、无过程奖励、无神经奖励模型,验证了 R1-Zero 范式在检索场景的迁移性。
  • 掩码是稳定关键:7b-base 上带掩码 Avg 0.431 vs 无掩码 0.343,提升 8.8 个百分点。
  • 模型越大越会搜索:7B 与次优基线 RAG 的差距(0.127)远大于 3B(0.058);14B 上差距进一步扩大到 0.198。
  • 行为涌现:模型自主学会"验证式检索"——集齐答案后仍额外搜索一轮核验结论;有效搜索次数随训练单调上升。
  • 工程可用:代码与模型权重开源(GitHub PeterGriffinJin/Search-R1),训练仅需问题-答案对,8 张 H100、500 步即可复现。

局限性

  • 奖励信号单一:EM 只刻画最终答案正确性,不反馈中间检索质量;作者明确未采用过程奖励。
  • 结构约束<search>/<information>/<answer> 模板约定输出格式,复杂工具组合与多信息源尚未支持。
  • 检索配置固定:top-3 段落、动作预算 $B=4$、单一 Wikipedia 语料,更广场景(多语种、实时事件)未验证。
  • RL 稳定性:GRPO 在长训练后出现奖励坍塌,需要检查点回退策略兜底(PPO 更稳,故默认 PPO)。

常见问题(FAQ)

Search-R1 和 RAG 有什么区别?

RAG 是"检索一次、拼接生成"的单轮流水线,查询由输入决定;Search-R1 把搜索引擎放进 RL 环境,模型在推理过程中自主决定何时搜索、搜什么,且经过 RL 优化搜索策略,7 数据集上相对 RAG 平均提升 24%(7B)。

Search-R1 需要人工标注的检索轨迹吗?

不需要。训练只用问题-答案对,奖励是最终答案的精确匹配(EM),模型通过 RL 自己学会生成查询与利用检索结果,无需任何过程监督或标注轨迹。

检索 token 掩码是什么,为什么重要?

轨迹中检索到的文本也占 token 位置,若它们参与梯度更新,检索内容会主导优化方向。掩码 $I(y_t)$ 把检索 token 从策略梯度与 KL 项中排除,只优化模型生成的 token——消融显示掩码带来 8.8 个百分点的平均提升。

Search-R1 支持哪些基座模型和 RL 算法?

支持 Qwen2.5-3B/7B/14B 的 Base 与 Instruct 版本,RL 算法兼容 PPO 与 GRPO(默认 PPO);检索后端与知识语料可替换(实验用 E5 + 2018 Wikipedia)。

GRPO 和 PPO 怎么选?

GRPO 收敛更快(无需 critic 预热),但长训练后可能奖励坍塌;PPO 更稳定、最终收益相当。论文默认选 PPO。

训练成本高吗?

单节点 8 张 H100、batch 512、500 步即可完成训练,配合 vLLM 加速 rollout;不需要大模型标注团队,数据效率是相对 SFT/拒绝采样路线的核心优势。

参考链接

  • arXiv 论文页:https://arxiv.org/abs/2503.09516
  • 项目主页(代码与模型):https://github.com/PeterGriffinJin/Search-R1
  • DeepSeek-R1(推理 RL 范式):https://arxiv.org/abs/2501.12948
  • DeepSeekMath(GRPO 算法):https://arxiv.org/abs/2402.03300
  • RAG 原始论文:https://arxiv.org/abs/2005.11401

给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

内容概要:本文围绕基于粒子群算法(PSO)的风电与水电(抽水蓄能)联合优化调度问题展开研究,旨在通过智能优化算法实现可再生能源的高效利用与电力系统的经济稳定运行。文中系统阐述了粒子群算法的核心原理及其在电力调度中的适用性,构建了综合考虑风电出力不确定性、抽水蓄能电站调节能力及系统运行约束的联合优化调度模型。采用Matlab进行算法编程与仿真求解,验证了该方法在降低系统综合运行成本、提升新能源消纳水平、增强电网调峰调频能力等方面的优越性能。研究进一步设计了多种对比场景,分析不同调度策略下的系统表现,充分展示了所提模型在应对复杂运行条件时的鲁棒性与实用价值。; 适合人群:具备一定电力系统分析基础和Matlab编程能力的研究生、科研人员,以及从事新能源并网调度、电力系统规划与运行等相关领域的工程师; 使用场景及目标:①应用于风电场与抽水蓄能电站的协同优化调度决策支持;②为高比例可再生能源接入的电力系统提供经济可靠的低碳调度方案;③服务于高校及科研院所中关于智能优化算法在能源系统中应用的教学与科研实验; 阅读建议:建议读者结合提供的Matlab代码深入理解算法实现细节与模型构建逻辑,重点关注目标函数设计、约束条件处理及参数设置对优化结果的影响,并通过复现仿真结果来掌握粒子群算法解决复杂非线性调度问题的关键技术要点。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

白拾ShiroX

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值