导读
这一集合解释学习系统要解决的问题,以及模型背后的设计选择。目前的强化学习系列从交互与马尔可夫模型出发,逐步推导策略梯度,再进入 PPO、GRPO 和 DPO。具体学习顺序见系列阅读路径,表示学习、序列模型与生成模型是后续方向。
关于模型与学习系统如何工作,以及背后想法的概念地图。
这一集合解释学习系统要解决的问题,以及模型背后的设计选择。目前的强化学习系列从交互与马尔可夫模型出发,逐步推导策略梯度,再进入 PPO、GRPO 和 DPO。具体学习顺序见系列阅读路径,表示学习、序列模型与生成模型是后续方向。
一个双语系列,九章,从零开始搭建强化学习:从它为什么是一个独特的学习问题出发,经过马尔可夫阶梯与 Bellman 机制,直到策略梯度的完整推导、PPO 的样本重用机制、GRPO 对 critic 的替代,以及 DPO 如何把偏好学习直接写成策略优化。
9 篇笔记