这个系列是什么

九章,从第一性原理搭建强化学习。系列从”强化学习为什么是一个真正不同的学习问题”出发,沿马尔可夫阶梯从纯粹的状态转移爬到决策过程,带着完整的压缩映射证明搭起 Bellman 机制,推导出策略梯度恒等式并覆盖 REINFORCE 与方差缩减,走到 PPO:在那里,采样的代价逼出了重要性采样、散度与裁剪这一整套装置;随后 GRPO 用组采样替代 PPO 的 critic;最后 DPO 从同一个 KL 正则化目标出发,将离线偏好对直接写成策略优化损失。

每一章都力求在其声明的范围内严谨:定义精确,定理给出证明而不是只引用结论;每一页独立可读,同时靠行内链接串起整条主线。中英文版本同步撰写。

阅读路径

  1. 强化学习问题:监督学习那套框架为什么会失效、交互循环、动作空间、模型,以及信用分配与探索这两个障碍
  2. 马尔可夫阶梯:作为”未来的充分统计量”的马尔可夫性质,然后一级一级搭出 MP、MRP、MDP
  3. 回报、价值与 Bellman 方程:回报的一步递归、两个价值函数,以及全部由那一条引理推出的每一个 Bellman 方程
  4. 已知模型下的规划:用压缩映射证明把那些恒等式变成算法,包括策略评估、策略改进、策略迭代、价值迭代
  5. 作为概率分布的策略:类别分布策略、对角高斯策略,以及对数似然目标
  6. 策略梯度(PG):完整推导、REINFORCE、reward-to-go、baseline
  7. 近端策略优化(PPO):重要性采样买来样本重用,它的方差与 surrogate 的局部性逼出「步子要小」,KL 散度度量这一步,而裁剪来维持它(或者说,并没有维持)
  8. 群体相对策略优化(GRPO):把 PPO 的 critic 换成一组样本的组内均值基线,把 KL 从上一个迭代改瞄向一个固定参考策略,再把整套机器读回到语言模型的 RLHF 上
  9. 直接偏好优化(DPO):从同一个 KL 正则化目标推导 DPO 损失,说明奖励模型与在线强化学习循环如何在偏好对中被消去

每一章内部也带有按此顺序排列的上一章/下一章导航,从任何一章进入都可以顺着读下去。

系列接下来去哪

从 DPO 往后,一条线继续讨论偏好优化的其他目标与其假设;另一条线把这些算法用到 diffusion 模型上,在那里,去噪链本身就是决策过程。这些章节计划作为下一批加入。

来源

概念骨架参考 Datawhale Easy RL;定义、证明与衔接论证由本系列独立展开,并补充了超出原书范围的内容(压缩映射证明、策略改进定理、reward-to-go 的因果性论证、高斯重参数化)。