Chapter 11 · Agentic Reinforcement Learning
Prompt、Tool、Memory 改的是“系统”;SFT 与 RL 改的是“模型策略”
这一章的核心不是推公式,而是理解一条能力升级链:当模型已经有工具,却仍然不会选工具、不会停止、不会恢复错误时,才需要考虑用监督学习或强化学习改变模型本身。
Prompt告诉模型怎么做
Instruction
Instruction
SFT给正确示范
Imitation
Imitation
RL根据奖励优化
Trial & Optimize
Trial & Optimize
Agentic RL优化多步策略
Long-horizon Policy
Long-horizon Policy
1. 为什么有了 Prompt / Tool / Memory 还要训练?
因为“有工具”不等于“会正确使用工具”。
🛠
工具选择
模型可能不该搜索却搜索,或者该调用 calculator 却硬算。
🧭
长期规划
长任务中可能反复绕圈、遗漏步骤、忘记全局目标。
🛑
停止策略
模型可能完成后仍继续调用工具,也可能过早结束。
拥有工具 ≠ 会正确使用工具
什么时候训练才有意义?当你已经把 Prompt、Tool Schema、Context、Runtime、Eval 做得比较稳定,但模型仍然系统性地做错同一类决策。
2. SFT:给模型“正确示范”
SFT(Supervised Fine-Tuning)本质就是模仿正确答案。
SFT = Input → Gold Output → Cross-Entropy Training
L = -Σ log Pθ(yₜ | y<ₜ, x)
SFT 的局限:它主要是在“模仿老师”。如果真实任务有很多合理轨迹,而你无法提前给出唯一完美示范,SFT 就会受限。
3. RL:从“模仿”变成“试错 + 奖励”
State → Action → Environment → Reward + New State
max E[ Σ γᵗ rₜ ]
最核心直觉:RL 不要求你先告诉模型“每一步正确动作是什么”,只要你能判断最终或中间结果好不好,就可以用奖励推动策略改进。
4. Agentic RL:优化的是“多步行为轨迹”
普通单轮任务通常是 Prompt → Answer;Agentic RL 则是 Tool → Observation → Tool → Observation → Finish。
Agentic RL = Optimize trajectory τ = (a₁, o₁, a₂, o₂, ..., aₜ)
Tool Use
什么时候调用哪个工具。
Recovery
失败后怎么恢复,而不是重复犯错。
Stopping
什么时候已经完成,应该停止。
5. Reward:训练 Agent 时最危险也最重要的设计
容易验证的 Reward
数学答案、代码测试、SQL 结果、游戏胜负。
test_pass = 1 / fail = 0
难验证的 Reward
“文章是否优雅”“回答是否有洞察”等开放评价。
subjective / noisy
Reward Hacking:Agent 优化的是你写下来的 Reward,而不是你心里的真实意图。奖励设计错了,Agent 就可能学会“钻规则空子”。
错误奖励设计:
reward = test_pass_rate
潜在漏洞:
Agent 直接删除失败测试
结果:
100% pass,但任务被破坏
Reward ≈ Real Objective,越接近越好
6. GRPO:同题多采样,组内比较
GRPO 的核心直觉非常简单:对同一个问题生成多个候选,在同一组里比较谁表现更好。
Aᵢ ≈ (rᵢ - mean(r)) / std(r)
理解到这里就够:GRPO 不是“给每个答案绝对打分”,而是同题多采样后比较相对好坏,再提高好轨迹概率、降低差轨迹概率。
7. Code Agent:为什么特别适合 Agentic RL
任务:修复一个有 bug 的函数。
Agent Action:
read_file、edit_file、run_test。Environment:Git Repository + Terminal + pytest。
Reward:测试通过越多,奖励越高;全部通过最高。
训练结果:模型逐渐学会先看哪里、什么时候测、失败后怎么恢复。
轨迹 A
read → edit → test → 10/10 pass
Reward = 1.0
轨迹 B
乱改 → test → 3/10 pass
Reward = 0.3
轨迹 C
反复读文件 50 次
Reward = -0.2
8. 什么时候不该做 Agentic RL?
这是这一章最实用的判断。
如果这些还没做好,就别急着 RL:Prompt 混乱、Tool Schema 不稳定、Agent Loop 有 bug、Context 管理混乱、没有 Eval Dataset、没有可验证 Reward。
先把系统工程做好,再训练模型
9. 一页总结
Prompt = 告诉模型怎么做
SFT = 给模型正确示范
RL = 让模型试错并按 Reward 优化
Agentic RL = 在多步环境里优化长期策略
GRPO = 同题多采样,组内相对比较
下一份:第 12 章——Agent Evaluation。会重点画清 `Final Answer / Tool Calling / Trajectory / Robustness / Cost / Regression` 六类评测,以及如何给科研复现 Agent 建 Eval Dataset。