导读

这一集合解释学习系统要解决的问题,以及模型背后的设计选择。目前的强化学习系列从交互与马尔可夫模型出发,逐步推导策略梯度,再进入 PPO、GRPO 和 DPO。具体学习顺序见系列阅读路径,表示学习、序列模型与生成模型是后续方向。