Agentic RL:从对齐偏好到训练行动者的范式跃迁

2263 字
11 分钟
Agentic RL:从对齐偏好到训练行动者的范式跃迁

2026-08-24 Agentic RL:从”对齐偏好”到”训练行动者”的范式跃迁#

📅 学习日期:2026-08-24 | 📚 来源:AI Agent 知识库 | 📝 综合文章数:5 篇

为什么选这个主题#

过去 30 天学了 20 个 Agent 子方向——Tool Use、Coding Agent、Computer Use、Harness、Multi-Agent 编排、协议标准化——但都聚焦”工程实现”。8-19 学 Deep Research 时顺带提到 RL 训练,今天直接补上”训练范式”这一层。Agentic RL(智能体强化学习) 是 2026 年整个行业最确定的趋势:蒸馏路径被巨头切断、SFT 走向轻量化、长程多轮任务必须靠 RL 突破。这是从”造一个 Agent”到”养一个 Agent”的关键转折。

核心要点#

要点 1:从 Chatbot 到 AgentRL,三层范式跃迁#

第 1 跳:Chatbot → Agent(2024-2025 已发生)。关键角色是 Tool:LLM 不再只”说话”,而是”调用工具 → 接收反馈 → 自主循环 → 直到任务完成”。Claude Code 是这一理念的集大成者。

第 2 跳:Agent → RL 时代(2026 正在发生)。OpenAI、Claude、Gemini 不再提供原始 CoT,连”投毒”都省了——直接云端托管。蒸馏路径被切断,只能自建 RL 基建。

第 3 跳:单轮 RLHF → 多轮 Agentic RL。Math 任务用 GRPO 单轮训练很爽,但 GPT-5 级别的长时间工程执行必须靠多轮 RL。这要求解决 Re-tokenize、MoE 路由坍塌、训推不一致等系统问题。

文章 1(原话):“后训练正全面走向 RL 时代,SFT 将变得越来越轻量化。“

要点 2:Agentic RL ≠ 把传统 RL 套到 LLM 上#

6 维本质差异(综合文章 2、3):

维度传统 RLHF / DPOAgentic RL
状态空间单一提示 s₀,任务立即结束动态状态流 sₜ,任务时长远大于 1
动作空间纯文本序列文本 ∪ 工具调用 ∪ API 请求
奖励结构单一标量 r(a)步骤级密集奖励 + 稀疏终局奖励
建模框架简化的 MDPPOMDP(部分可观测)
核心问题单次偏好对齐信用分配(哪些中间步骤贡献了最终结果)
优化目标E[r(a)]E[Σ γᵗ R(sₜ, aₜ)]

六大能力跃迁:从”被动语言生成器”到”主动问题解决者”——规划、工具使用、记忆、推理、自我改进、感知。

文章 2 关键判断:Agentic RL 是迈向 AGI 的关键路径。

要点 3:算法选型——短程 GRPO,长程 PPO(2026 关键反转)#

算法价值网络显存适用场景代表案例
PPO需 Critic巨大(Critic 占 40-50%+)长程多轮 Agent 任务智谱 GLM-5.2(2026.6 回归 PPO)
GRPO移除 Critic,组内相对比较低短程推理(数学/代码/可验证任务)DeepSeek-R1
DPO离线,无需奖励模型极低偏好对齐的离线场景简化流程
SAC最大熵高连续控制、不确定性高环境机器人控制

2026 年关键反转:智谱 GLM-5.2 在长程 RL 阶段放弃 GRPO 回归 PPO,证明算法选择必须与任务特性深度解耦——短程用 GRPO 节省显存,长程用 PPO 保障 token 级优势估计。

文章 3 案例:47 种信用分配方法中,Agentic RL 部分几乎空白(Chenchen Zhang 2026.4 综述)。

要点 4:八大工程原则(生产级 Agentic RL 的施工图)#

4 层架构(文章 3):

  • 系统架构层:模块化设计(策略/环境/奖励/训练解耦)。代表:字节 HybridFlow(verl)、MiniMax Forge、AgentGym-RL
  • 训练信号层:轨迹结构 + 智能体掩码(RL+SFT 协同:L = L_RL + α·L_SFT)+ 过程奖励(PRM 用于长链推理,ORM 用于答案明确任务)
  • 算法优化层:优势归一化(ERPO)、可扩展阶段采样(分离式 vs 共置架构)、稳定性与探索(StarPO-S 应对”回声陷阱”)
  • 训练策略层:任务课程(短视野 h₁ → 中等 h₂ → 长视野 h₃ 渐进式训练)

要点 5:多智能体 RL 与单 Agent RL 的关键差异#

文章 5 揭示了一个被忽略的事实:多 Agent 系统的 Token 成本是单 Agent 的 3-10 倍(每个 Agent 都有自己的 System Prompt 和对话历史)。这不仅是工程优化问题,更影响 RL 训练——奖励信号如何在多个 Agent 之间分配?

文章 2 补充:集体智能涌现的机制(PBT 种群训练、AlphaStar 自我博弈、AlphaEvolve 进化优化、RL Swarm 点对点学习、MAGRPO 群体级相对策略优化)。CRLD 理论框架将 MARL 视为复杂动力系统,揭示滞后效应等集体现象。

文章 5 公式:N 个 Agent × 每轮 T Token × /Token=每轮成本。4Agent×2000Token×GPT−4=/Token = 每轮成本。4 Agent × 2000 Token × GPT-4 =0.12/轮 × 20 轮 = 2.4/任务。日活10万用户=每天2.4/任务。日活 10 万用户 = 每天240,000。

分歧与讨论#

争议 1:RLHF 到底有没有意义?#

  • 质疑派(NIPS 论文):RL 可能限制 Base Model 的上限
  • 支持派(AlphaGo 案例):RL 足以从零训练出超越人类的 SOTA 模型
  • 折中观点(文章 1):与其质疑,不如解决当前 RLHF 的 Scaling 问题

争议 2:算法路线——GRPO 还是 PPO?#

  • DeepSeek-R1 路线:GRPO 无需 Critic,简洁高效,突破数学/代码
  • 智谱 GLM-5.2 路线:长程任务必须回归 PPO 保障稳定性
  • 共识:没有”银弹”,算法必须按任务特性选择

争议 3:RL 训练的稳定性#

  • 乐观派:训练崩溃是”工程问题”而非”理论问题”
  • 谨慎派(文章 3):ARLArena 框架指出 4 个核心维度都会引发不稳定
  • 现实方案:动态温度调度、熵正则化、非对称裁剪(Clip-Higher)

与已学内容的联系#

已学主题与今天的关联点
7-29 Multi-Agent 多智能体协作本文多智能体 RL 视角:编排模式决定学习信号如何流动
8-03 Tool UseRL 优化的核心目标之一是”何时/调用何种工具”
8-04 PlanningRL 让规划从”启发式”升级为”信用分配驱动”
8-05 安全RLHF 的”奖励破解”(Reward Hacking)= 安全风险的新维度
8-11 Coding AgentSWE-RL 用 GRPO 训练代码智能体(直接落地案例)
8-14 协议标准化A2A 协议 + RL 训练 = 多 Agent 协同训练的基础设施
8-17/18 HarnessHarness 不仅是工程框架,更是 RL 训练的关键约束
8-19 Deep Research AgentSearch-R1 是 Agentic RL 在搜索智能体的代表工作
8-20 Computer Use AgentOSWorld、CRAFT-GUI 正在用 RL 训练 GUI 智能体

今天补完的拼图:之前学的是”如何构建/部署 Agent”,今天学的是”如何训练 Agent 让它变强”。

💡 思考题#

  1. 信用分配难题:在多轮 Agent 任务中,假设 Agent 完成了 10 步工具调用才成功,但其中第 3 步调用了一个无关 API。如何让 RL 算法识别这种”干扰步骤”?这与 DPO 的”离线偏好”思路有何本质冲突?
  2. 场景应用题:你正在训练一个 Deep Research Agent(参考 8-19 内容)。如果用 GRPO 训练,10 步搜索循环中只有第 10 步拿到答案(奖励=1),前 9 步奖励=0。会出现什么问题?应该改用 PPO 还是设计新的奖励塑形策略?
  3. 延伸思考:当 Multi-Agent 系统的 Token 成本是单 Agent 的 3-10 倍(文章 5),而 RL 训练本身就需要海量 Rollout 采样,是否意味着 Multi-Agent RL 在经济上短期内不可行?哪些技术突破可能改变这个判断?

🎯 行动项#

  1. 读源码:clone Verl 框架(https://github.com/volcengine/verl),跑通一个 GRPO 训练 Qwen2.5 的最小例子,理解训推分离架构如何解决”训推不一致”问题。
  2. 设计实验:在 LangGraph 中搭建一个 3 步工具调用 Agent(搜索→计算→总结),用 VERL 训练,验证 Clip-Higher 非对称裁剪是否真的能防止”熵崩塌”。
  3. 追踪前沿:订阅 Chenchen Zhang 团队 2026.4 综述的后续工作,重点关注”信用分配”在 Agentic RL 中的新方法——这是目前最大的理论空白。
  4. 写一段对比:用 200 字对比 RLHF / RLAIF / RLVR 三种范式在”奖励来源”上的根本差异,并思考为什么 RLVR 在 2026 年突然爆发。

参考文章#

  • 《2026,进入AgentRL时代!》(MLNLP 社区,2026-01-03)—— 提供范式转移的高层视角,明确”后训练走向 RL 时代”的判断(media_id: wechatarticle_...23ced4046072cc63c37312b2c11bf7ed...)
  • 《Agentic RL:从自我进化到创造性涌现的智能体强化学习新范式》—— 给出 Agentic RL 的完整形式化框架(POMDP)、6 大能力、参数级/非参数级自我提升路径(media_id: note_...74130540734853887...)
  • 《Agentic RL 正在重新定义 AI 的下限》—— 8 大工程原则 + PPO/GRPO 对比 + 信用分配理论空白分析(media_id: wechatarticle_...0cabe524448ed6be8a531bcb56056d59...)
  • 《驱动 Agent 自主演进的核心强化学习方法深度解析与前沿演进》—— PPO/DQN/SAC/GRPO/DPO/A3C 6 大算法的详细对比表 + 选型决策树(media_id: note_...74184793553752767...)
  • 《多 Agent 编排:让 AI 团队高效协作》—— 从工程视角揭示多 Agent Token 成本问题,间接影响多 Agent RL 训练的经济性(media_id: wechatarticle_...07e7bee4545c0fdff762090d975119f0...)

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Agentic RL:从对齐偏好到训练行动者的范式跃迁
https://www.zgf.me/posts/2026-08-24-agentic-rl从_对齐偏好_到/
作者
赵某人
发布于
2026-08-24
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
赵某人
俯视泥土,仰望星辰
公告
欢迎来到我的博客!这是一则示例公告。
分类
标签
最新动态
站点统计
文章
28
分类
1
标签
58
总字数
129,420
运行时长
0 天
最后活动
0 天前
站点信息
构建平台
Local
博客版本
Firefly v6.14.5
文章许可
CC BY-NC-SA 4.0