导读

这九章从第一性原理搭建强化学习。先明确学习问题与马尔可夫模型,再从回报和价值函数推导 Bellman 方程,并把方程转成规划算法。把策略看作概率分布之后,便能继续推导策略梯度,再进入 PPO、GRPO 与 DPO。

各章通过定义、证明和例子说明概念之间的联系,上一章与下一章导航遵循下面的阅读顺序。后续计划讨论其他偏好优化目标,以及 diffusion 模型中的决策过程。概念起点参考 Datawhale Easy RL,推导与衔接论证独立展开,并补充相关内容。