导读
这九章从第一性原理搭建强化学习。先明确学习问题与马尔可夫模型,再从回报和价值函数推导 Bellman 方程,并把方程转成规划算法。把策略看作概率分布之后,便能继续推导策略梯度,再进入 PPO、GRPO 与 DPO。
各章通过定义、证明和例子说明概念之间的联系,上一章与下一章导航遵循下面的阅读顺序。后续计划讨论其他偏好优化目标,以及 diffusion 模型中的决策过程。概念起点参考 Datawhale Easy RL,推导与衔接论证独立展开,并补充相关内容。
一个双语系列,九章,从零开始搭建强化学习:从它为什么是一个独特的学习问题出发,经过马尔可夫阶梯与 Bellman 机制,直到策略梯度的完整推导、PPO 的样本重用机制、GRPO 对 critic 的替代,以及 DPO 如何把偏好学习直接写成策略优化。
这九章从第一性原理搭建强化学习。先明确学习问题与马尔可夫模型,再从回报和价值函数推导 Bellman 方程,并把方程转成规划算法。把策略看作概率分布之后,便能继续推导策略梯度,再进入 PPO、GRPO 与 DPO。
各章通过定义、证明和例子说明概念之间的联系,上一章与下一章导航遵循下面的阅读顺序。后续计划讨论其他偏好优化目标,以及 diffusion 模型中的决策过程。概念起点参考 Datawhale Easy RL,推导与衔接论证独立展开,并补充相关内容。
在算出第一个梯度之前必须先搭好的东西:为什么把老师从监督学习里拿走之后,剩下的问题还不是良定义的;取代数据集的交互循环;循环故意留白的动作空间和模型;以及两个在监督学习里没有对应物的结构性障碍,信用分配与探索。
三级阶梯,一次加一个假设。马尔可夫性质决定了什么样的概括配叫做状态,它恰好就是充分统计量被用在时间上;本章也给它标了价:条件于完整历史要 n^(T+1) 个参数,而且无论有多少内存都无法从有限数据中学到,这才是这个假设「使之成为可能」而非「只是方便」的地方。然后马尔可夫过程与奖励过程依次加入转移和打分,但都没有能动性;马尔可夫决策过程加入动作,并因此迫使我们需要第二个价值函数。
一行式子干完了全部的活:回报满足 G_t = R_{t+1} + gamma*G_{t+1}。本章里的一切,两个价值函数、Bellman 期望方程、最优性方程,都是这一条递归被推过一层期望、再被优化一次的结果。附 Bellman 最优性原理,那才是平均可以换成最大值的真正依据。
在模型已知的前提下,把 Bellman 方程从恒等式变成算法。一个想法撑起整章:两个 Bellman 算子都是 gamma-压缩映射,于是 Banach 不动点定理一次性交付存在性、唯一性和几何收敛。内容包括策略评估、策略改进定理、策略迭代、价值迭代,以及已知模型这个前提失效的确切位置。
策略可以只是一个从状态到动作的函数,也可以是一个完整的、关于动作的概率分布。这篇笔记要讲清楚:为什么第二种看起来更麻烦的选择在实践中会胜出(而且是出于两个真正不同的理由),并且为离散和连续动作空间分别搭建出具体的类别分布策略和对角高斯策略。
一篇严谨的策略梯度推导笔记:从轨迹回报目标出发,用 log-derivative(score-function)技巧得到策略梯度恒等式,再到 REINFORCE、baseline / advantage 方差缩减论证,最后接上 PPO 的桥梁。
一条链,每一环都是上一环逼出来的。策略梯度是 on-policy 的,所以每个昂贵的样本只够支撑一次更新就被扔掉。重要性采样买来了重用,但它的方差随两个策略的分离而增长,而它给出的 surrogate 只在旧参数那一点上一阶正确。两个失效指向同一件事:别跑远。KL 散度让「近」变得精确,clipping 廉价地维持它,尽管正如本章最后一节所示,它其实什么也没保证。
PPO 除了策略,还需要一个 critic 来估计 advantage。可在整段生成结束后才得到奖励的任务里,critic 既昂贵,也难以可靠地学习。GRPO 用同一 prompt 下的一组采样输出估计 baseline,以组均值替代 critic 所学习的价值。本章从 PPO 出发,逐步推导 GRPO 的目标,再把它映射回语言模型后训练这个最常见的应用场景。
DPO 是一种通用的条件偏好学习范式:在提高偏好一致性的同时,不要偏离参考策略太远。若手中已有偏好对,是否一定要先训练奖励模型,再运行强化学习循环?答案是否定的。把 KL 正则化目标先解到最优策略的形式,再代回 Bradley-Terry 偏好模型,奖励会消失,留下一个直接作用于任意条件概率模型的二元分类损失。