Back to blog

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

LLM 智能体强化学习综述:从被动序列生成器到自主决策智能体

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

一、论文概述

项目内容
标题The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
作者Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai
机构NUS, Imperial College Oxford, 上海 AI Lab, 清华大学, 牛津大学, 多所国际高校
论文arXiv:2509.02547
发布2025年9月
领域人工智能 (cs.AI), 计算语言学 (cs.CL)
规模综述超过 500 篇近期工作

二、核心思想

范式转变:从 LLM-RL 到 Agentic RL

本综述的核心论点是:Agentic RL 标志着从传统 LLM-RL 的范式转变——将 LLM 从被动的序列生成器重新定义为嵌入复杂动态世界中的自主决策智能体。

范式转变

问题定义

传统 LLM-RL(如 PBRFT)将 RL 训练建模为退化的单步 MDP:

  • 状态空间:仅包含单个 prompt s0s_0
  • 动作空间:纯文本序列
  • 转移:确定性终止
  • 奖励:单个标量 r(a)r(a)
  • 视界:T=1T=1

Agentic RL 则建模为时序扩展的 POMDP:

  • 状态空间:st∈Sagents_t \in \mathcal{S}_{\text{agent}},智能体获得观测 ot=O(st)o_t = O(s_t)
  • 动作空间:A=Atext∪Aaction\mathcal{A} = \mathcal{A}_{\text{text}} \cup \mathcal{A}_{\text{action}}
  • 转移:动态转移函数 P(st+1∣st,at)P(s_{t+1}|s_t, a_t)
  • 奖励:步级奖励 R(st,at)R(s_t, a_t),结合稀疏任务和密集过程奖励
  • 目标:Eτ∼πθ[∑tγtR(st,at)]\mathbb{E}_{\tau \sim \pi_\theta}[\sum_t \gamma^t R(s_t, a_t)]

形式化对比

概念传统 PBRFTAgentic RL
状态空间 S\mathcal{S}{s0}\{s_0\}(单个 prompt);立即终止st∈Sagents_t \in \mathcal{S}_{\text{agent}};ot=O(st)o_t = O(s_t)
动作空间 A\mathcal{A}纯文本序列Atext∪Aaction\mathcal{A}_{\text{text}} \cup \mathcal{A}_{\text{action}}
转移 P\mathcal{P}确定性终止动态转移 $P(s_{t+1}
奖励 R\mathcal{R}单标量 r(a)r(a)步级 R(st,at)R(s_t, a_t);稀疏+密集
目标 J(θ)J(\theta)Ea∼πθ[r(a)]\mathbb{E}_{a \sim \pi_\theta}[r(a)]Eτ∼πθ[∑tγtR(st,at)]\mathbb{E}_{\tau \sim \pi_\theta}[\sum_t \gamma^t R(s_t, a_t)]

三、技术架构

整体分类框架

本综述提出双重分类法:

  1. 能力视角(Section 3):规划、工具使用、记忆、自我改进、推理、感知
  2. 任务视角(Section 4):搜索、代码、数学、GUI、视觉、具身、多智能体

六大能力

核心公式

REINFORCE

L(θ)=−1N∑i=1N[∑t=0T−1log⁡πθ(at(i)∣s0)]R(s0,a(i))\mathcal{L}(\theta) = -\frac{1}{N}\sum_{i=1}^{N}\left[\sum_{t=0}^{T-1}\log\pi_\theta(a_t^{(i)}|s_0)\right]\mathcal{R}(s_0, a^{(i)})

其中 a(i)∼πθ(a∣s0)a^{(i)} \sim \pi_\theta(a|s_0) 是第 ii 个采样响应,R(s0,a)\mathcal{R}(s_0, a) 是任务完成后的最终奖励。

PPO (Proximal Policy Optimization)

L(θ)=E[min⁡(rt(θ)A^t,clip(rt(θ),1−ϵ,1+ϵ)A^t)]\mathcal{L}(\theta) = \mathbb{E}\left[\min\left(r_t(\theta)\hat{A}_t, \text{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon)\hat{A}_t\right)\right]

其中 rt(θ)=πθ(at∣st)πθold(at∣st)r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{old}}(a_t|s_t)},A^t=Rt−Vθ(st)\hat{A}_t = R_t - V_\theta(s_t)。

关键缺点:依赖单独的 critic 网络进行优势估计,大幅增加训练参数量。

DPO (Direct Preference Optimization)

LDPO=−E(yw,yl)∼D[log⁡σ(βlog⁡πθ(yw∣s0)πref(yw∣s0)−βlog⁡πθ(yl∣s0)πref(yl∣s0))]\mathcal{L}_{DPO} = -\mathbb{E}_{(y_w, y_l) \sim \mathcal{D}}\left[\log\sigma\left(\beta\log\frac{\pi_\theta(y_w|s_0)}{\pi_{ref}(y_w|s_0)} - \beta\log\frac{\pi_\theta(y_l|s_0)}{\pi_{ref}(y_l|s_0)}\right)\right]

其中 πref\pi_{ref} 是参考策略,β\beta 是超参数。关键缺点:性能受限于静态偏好数据集的质量和覆盖范围。

GRPO (Group Relative Policy Optimization)

LGRPO=E[∑t=0T−1min⁡(rt(θ)A^t(g),clip(rt(θ),1−ϵ,1+ϵ)A^t(g))]\mathcal{L}_{GRPO} = \mathbb{E}\left[\sum_{t=0}^{T-1}\min\left(r_t(\theta)\hat{A}_t^{(g)}, \text{clip}(r_t(\theta), 1-\epsilon, 1+\epsilon)\hat{A}_t^{(g)}\right)\right]

优势函数通过组内相对奖励估计:

A^t(g)=R(s0,a(g))−mean({R(s0,a(g′))}g′=1G)std({R(s0,a(g′))}g′=1G)\hat{A}_t^{(g)} = \frac{R(s_0, a^{(g)}) - \text{mean}(\{R(s_0, a^{(g')})\}_{g'=1}^{G})}{\text{std}(\{R(s_0, a^{(g')})\}_{g'=1}^{G})}

关键优势:消除绝对值 critic,高度样本高效,计算开销低。

RL 算法族谱

方法族代表方法核心机制
PPO 家族PPO, VAPO, PF-PPO, VinePPO, PSGPO策略梯度 + 剪切 + 可选 KL 惩罚
DPO 家族DPO, β-DPO, SimPO, IPO, KTO, ORPO, Step-DPO, LCPO偏好优化,无需显式奖励模型
GRPO 家族GRPO, DAPO, GSPO组相对奖励,消除 critic

动作空间设计

Agentic RL 的动作空间包含两个不相交的子空间:

A=Atext∪Aaction\mathcal{A} = \mathcal{A}_{\text{text}} \cup \mathcal{A}_{\text{action}}

  • Atext\mathcal{A}_{\text{text}}:通过自回归解码生成自由形式的自然语言 token
  • Aaction\mathcal{A}_{\text{action}}:由特殊 token <action_start> 和 <action_end> 界定的结构化非语言动作(如工具调用、环境交互)

四、能力视角:六大核心能力

1. 规划 (Planning)

两大范式:

  • 外部引导:RL 作为搜索过程的外部引导,训练辅助奖励/启发式函数(如奖励模型引导 MCTS)
  • 内部驱动:RL 直接优化 LLM 的规划行为,通过环境交互的试错反馈内化到模型参数

未来方向:综合两种范式,将结构化搜索过程本身内化到智能体中。

2. 工具使用 (Tool Use)

工具使用演进

演进路径:

  1. 提示工程:ReAct 风格的 Thought-Action-Observation 循环
  2. SFT 模仿:在工具调用轨迹上微调
  3. RL 优化:从模仿固定模式转向优化最终任务性能
  4. 工具集成推理 (TIR):深度交织的多轮推理系统

当前状态:工具集成 RL 已成为先进智能体模型的基线特征(OpenAI o3, Kimi K2, Qwen QwQ-32B 等)。

3. 记忆 (Memory)

阶段方法特点
无 RL 记忆MemoryBank, MemGPT, HippoRAG预定义记忆管理策略
可训练记忆控制器显式 token / 隐式状态智能体自主调控记忆状态
结构化记忆Zep (时序知识图谱), A-MEM (原子记忆), G-Memory (层次图)超越扁平 token 序列
RL 控制记忆RL 决定存储/检索/遗忘动态子系统

4. 自我改进 (Self-Improvement)

三个层次:

  1. 提示式反思:Reflexion 等,单次推理中的语言自我纠正(无梯度更新)
  2. RL 内化反思:通过梯度更新将反思能力内化到模型参数
  3. 自主循环:自我博弈 + 搜索引导精化,无需人类标注数据的无界自我改进

5. 推理 (Reasoning)

双过程理论:

  • 快速推理 (System 1):启发式驱动,快速直觉,无显式中间步骤
  • 慢速推理 (System 2):显式中间推理链,链式思维,多步验证

RL 挑战:在智能体场景中可靠训练慢思考推理能力,面临训练稳定性、多样化环境兼容等挑战。

6. 感知 (Perception)

多模态感知能力,使智能体能够处理视觉、听觉等非文本输入。

五、任务视角:关键应用领域

领域演进树

领域演进树

1. 搜索与研究智能体

  • 开源方法:DeepRetrieval (GRPO 训练查询生成), Search-R1, R1-Searcher
  • 闭源方法:OpenAI DeepResearch, Gemini Deep Research
  • 挑战:BrowseComp 基准测试暴露长程规划、页面工具使用、跨源验证的差距

2. 代码智能体

阶段任务代表方法
单轮代码生成函数编写、竞赛题AceCoder, StepCoder, PSGPO
迭代代码精化调试、多轮改进RLEF, IterPref, LeDex
自动软件工程仓库级任务、SWE-benchDeepSWE, SWE-RL, DAPO

3. 数学智能体

  • 非形式化推理:自然语言数学推理,RLVR (DAPO, GRPO, GRESO)
  • 形式化推理:Lean/Isabelle 等证明助手中的形式化证明

4. GUI 智能体

  • 静态环境:WebShop, MiniWoB++
  • 交互环境:AndroidWorld, 动态网页
  • 挑战:长程规划、状态空间巨大、奖励稀疏

5. 具身智能体

机器人控制、物理世界交互。

6. 多智能体系统

协作、竞争、通信协议的学习。

六、环境与框架

环境分类

类别代表环境特点
Web 环境WebShop, MiniWoB++, Mind2Web静态/动态网页交互
GUI 环境AndroidWorld, AITW移动/桌面 GUI 操作
代码环境Debug-Gym, HumanEval, SWE-bench可执行验证
领域特定ScienceWorld, PaperBench, MLE-Dojo科学/研究任务
通用环境ALFWorld, BabyAI文字冒险/导航

RL 框架

框架类型关键特性
veRL训练框架高效训练-Rollout 协同
OpenRLHF训练框架开源 RL 对齐
TRL训练框架HuggingFace 生态集成
AgentGym环境框架多环境统一接口

七、核心创新

创新点说明影响
形式化区分首次系统性地将 Agentic RL 与传统 LLM-RL 从 MDP/POMDP 角度形式化区分为领域建立理论基础
双重分类法能力视角 + 任务视角的全面分类框架覆盖 500+ 篇工作
动作空间形式化A=Atext∪Aaction\mathcal{A} = \mathcal{A}_{\text{text}} \cup \mathcal{A}_{\text{action}} 的统一表示连接语言生成与环境交互
RL 算法族谱PPO/DPO/GRPO 三大族系的系统梳理算法选择指导
实用资源汇编环境、基准、框架的实践指南加速未来研究

八、开放挑战与未来方向

1. 可信度 (Trustworthiness)

  • 安全风险:智能体的攻击面比标准 LLM 更大(工具、记忆、规划模块)
  • 奖励黑客:RL 可能放大不安全行为——智能体学习将不安全动作作为最大化奖励的最有效路径
  • 幻觉:结果驱动的 RL 可能鼓励虚假关联,产生自信但无依据的中间推理
  • 谄媚:智能体倾向于迎合用户观点而非提供客观判断
  • 缓解策略:沙箱隔离、基于过程的奖励、谄媚感知奖励模型

2. 扩展智能体训练

  • Agent RL Scaling Law:更长训练视界系统性提升工具使用频率、推理深度和任务准确率
  • 熵坍缩:大模型 + RL 可能导致输出分布收窄,限制多样性
  • 跨域交互:数学、代码、逻辑等领域的 RL 训练存在协同和冲突
  • 训练效率:POLARIS 等通过数据难度校准、多样性采样、推理长度扩展提升效率

3. 扩展智能体环境

  • 环境自动化:从静态环境转向动态可优化系统
  • 课程生成:自动课程生成,环境作为主动教师
  • 奖励工程:自动设计奖励信号

九、总结

核心贡献

  1. 范式形式化:首次系统性地将 Agentic RL 与传统 LLM-RL 从 MDP/POMDP 角度进行形式化区分
  2. 双重分类框架:能力视角(规划/工具/记忆/自我改进/推理/感知)+ 任务视角(搜索/代码/数学/GUI/视觉/具身/多智能体)
  3. 算法梳理:PPO/DPO/GRPO 三大族系的系统性比较和演进脉络
  4. 资源汇编:整合环境、基准、框架为实用参考指南
  5. 挑战展望:可信度、训练扩展、环境扩展三大前沿方向

技术影响

  • 为 Agentic RL 领域建立统一的理论框架和术语体系
  • 揭示 RL 作为将静态能力转化为自适应鲁棒行为的关键机制
  • 为构建可扩展通用 AI 智能体提供路线图

局限性

  • 综述覆盖范围广但深度有限,每个子领域可进一步展开
  • 部分新兴工作(2025年下半年)可能未被覆盖
  • 闭源系统(OpenAI, Anthropic)的技术细节有限
  • 缺乏统一的跨领域评估基准

十、参考资源

  • 论文: arXiv:2509.02547
  • 关键引用: 500+ 篇近期工作
  • 核心参考:
    • PPO: Schulman et al., 2017
    • DPO: Rafailov et al., 2024
    • GRPO: DeepSeek, 2025
    • ReAct: Yao et al., 2023
    • Reflexion: Shinn et al., 2023---

分析日期: 2026-06-04