Chapter 11 · Agentic Reinforcement Learning

Prompt、Tool、Memory 改的是“系统”;SFT 与 RL 改的是“模型策略”

这一章的核心不是推公式,而是理解一条能力升级链:当模型已经有工具,却仍然不会选工具、不会停止、不会恢复错误时,才需要考虑用监督学习或强化学习改变模型本身。

Prompt告诉模型怎么做
Instruction
SFT给正确示范
Imitation
RL根据奖励优化
Trial & Optimize
Agentic RL优化多步策略
Long-horizon Policy

1. 为什么有了 Prompt / Tool / Memory 还要训练?

因为“有工具”不等于“会正确使用工具”。

🛠

工具选择

模型可能不该搜索却搜索,或者该调用 calculator 却硬算。

🧭

长期规划

长任务中可能反复绕圈、遗漏步骤、忘记全局目标。

🛑

停止策略

模型可能完成后仍继续调用工具,也可能过早结束。

拥有工具 ≠ 会正确使用工具
什么时候训练才有意义?当你已经把 Prompt、Tool Schema、Context、Runtime、Eval 做得比较稳定,但模型仍然系统性地做错同一类决策。

2. SFT:给模型“正确示范”

SFT(Supervised Fine-Tuning)本质就是模仿正确答案。

SFT = Input → Gold Output → Cross-Entropy Training
Input “北京天气?” Gold Action get_weather("北京") Train 提高正确输出概率 Better Imitation
L = -Σ log Pθ(yₜ | y<ₜ, x)
SFT 的局限:它主要是在“模仿老师”。如果真实任务有很多合理轨迹,而你无法提前给出唯一完美示范,SFT 就会受限。

3. RL:从“模仿”变成“试错 + 奖励”

State → Action → Environment → Reward + New State
Agent / Policy 选择 Action Environment 执行并返回结果 Reward 好不好?
max E[ Σ γᵗ rₜ ]
最核心直觉:RL 不要求你先告诉模型“每一步正确动作是什么”,只要你能判断最终或中间结果好不好,就可以用奖励推动策略改进。

4. Agentic RL:优化的是“多步行为轨迹”

普通单轮任务通常是 Prompt → Answer;Agentic RL 则是 Tool → Observation → Tool → Observation → Finish。

Prompt LLM Action 1 Tool Observation 1 LLM Action 2 Tool Observation 2 Finish Final Result Reward
Agentic RL = Optimize trajectory τ = (a₁, o₁, a₂, o₂, ..., aₜ)

Tool Use

什么时候调用哪个工具。

Recovery

失败后怎么恢复,而不是重复犯错。

Stopping

什么时候已经完成,应该停止。

5. Reward:训练 Agent 时最危险也最重要的设计

容易验证的 Reward

数学答案、代码测试、SQL 结果、游戏胜负。

test_pass = 1 / fail = 0

难验证的 Reward

“文章是否优雅”“回答是否有洞察”等开放评价。

subjective / noisy
Reward Hacking:Agent 优化的是你写下来的 Reward,而不是你心里的真实意图。奖励设计错了,Agent 就可能学会“钻规则空子”。
错误奖励设计: reward = test_pass_rate 潜在漏洞: Agent 直接删除失败测试 结果: 100% pass,但任务被破坏
Reward ≈ Real Objective,越接近越好

6. GRPO:同题多采样,组内比较

GRPO 的核心直觉非常简单:对同一个问题生成多个候选,在同一组里比较谁表现更好。

Question 37 × 84 = ? A: 3108 ✓ B: 3018 ✗ C: 3108 ✓ D: 3208 ✗ Group Relative 计算组内相对表现 好于平均 → ↑概率 差于平均 → ↓概率 Policy Update Better sampling
Aᵢ ≈ (rᵢ - mean(r)) / std(r)
理解到这里就够:GRPO 不是“给每个答案绝对打分”,而是同题多采样后比较相对好坏,再提高好轨迹概率、降低差轨迹概率。

7. Code Agent:为什么特别适合 Agentic RL

任务:修复一个有 bug 的函数。
Agent Action:read_fileedit_filerun_test
Environment:Git Repository + Terminal + pytest。
Reward:测试通过越多,奖励越高;全部通过最高。
训练结果:模型逐渐学会先看哪里、什么时候测、失败后怎么恢复。

轨迹 A

read → edit → test → 10/10 pass

Reward = 1.0

轨迹 B

乱改 → test → 3/10 pass

Reward = 0.3

轨迹 C

反复读文件 50 次

Reward = -0.2

8. 什么时候不该做 Agentic RL?

这是这一章最实用的判断。

Prompt / Tool Agent Loop Context / Eval Collect Failures SFT 先教基本行为 Agentic RL 有数据、有 Reward 再做
如果这些还没做好,就别急着 RL:Prompt 混乱、Tool Schema 不稳定、Agent Loop 有 bug、Context 管理混乱、没有 Eval Dataset、没有可验证 Reward。
先把系统工程做好,再训练模型

9. 一页总结

Prompt = 告诉模型怎么做
SFT = 给模型正确示范
RL = 让模型试错并按 Reward 优化
Agentic RL = 在多步环境里优化长期策略
GRPO = 同题多采样,组内相对比较
Pretrained SFT Agent Rollout Reward GRPO
下一份:第 12 章——Agent Evaluation。会重点画清 `Final Answer / Tool Calling / Trajectory / Robustness / Cost / Regression` 六类评测,以及如何给科研复现 Agent 建 Eval Dataset。