直接偏好优化(DPO)
DPO 是一种通用的条件偏好学习范式:在提高偏好一致性的同时,不要偏离参考策略太远。若手中已有偏好对,是否一定要先训练奖励模型,再运行强化学习循环?答案是否定的。把 KL 正则化目标先解到最优策略的形式,再代回 Bradley-Terry 偏好模型,奖励会消失,留下一个直接作用于任意条件概率模型的二元分类损失。

杨星宇 · 莫纳什大学 · 计算机
我希望长期把 AI 当作研究方向来做。现在最吸引我的是表征学习、可解释性、 语言,以及学习系统背后的数学结构。我也会围绕阅读、笔记和实验搭一些工具, 因为当想法变得可检查、可连接时,我通常理解得更清楚。
一个关于表征、解释,以及学习系统底层数学结构的研究笔记与公开第二大脑。
DPO 是一种通用的条件偏好学习范式:在提高偏好一致性的同时,不要偏离参考策略太远。若手中已有偏好对,是否一定要先训练奖励模型,再运行强化学习循环?答案是否定的。把 KL 正则化目标先解到最优策略的形式,再代回 Bradley-Terry 偏好模型,奖励会消失,留下一个直接作用于任意条件概率模型的二元分类损失。
PPO 除了策略,还需要一个 critic 来估计 advantage。可在整段生成结束后才得到奖励的任务里,critic 既昂贵,也难以可靠地学习。GRPO 用同一 prompt 下的一组采样输出估计 baseline,以组均值替代 critic 所学习的价值。本章从 PPO 出发,逐步推导 GRPO 的目标,再把它映射回语言模型后训练这个最常见的应用场景。
一条链,每一环都是上一环逼出来的。策略梯度是 on-policy 的,所以每个昂贵的样本只够支撑一次更新就被扔掉。重要性采样买来了重用,但它的方差随两个策略的分离而增长,而它给出的 surrogate 只在旧参数那一点上一阶正确。两个失效指向同一件事:别跑远。KL 散度让「近」变得精确,clipping 廉价地维持它,尽管正如本章最后一节所示,它其实什么也没保证。
一篇立场文章,谈语言学为何从未真正离开过我对 AI、数学与计算机科学的学习:用模式把握结构的那种直觉,反复出现在语言谱系分类、句法树、范畴语法,以及 NLP 领域语言学家与统计学家之间的旧争论里。
策略可以只是一个从状态到动作的函数,也可以是一个完整的、关于动作的概率分布。这篇笔记要讲清楚:为什么第二种看起来更麻烦的选择在实践中会胜出(而且是出于两个真正不同的理由),并且为离散和连续动作空间分别搭建出具体的类别分布策略和对角高斯策略。