目标
这个 collection 用来整理人工智能的事实性笔记:模型家族的发展史、催生它们的问题,以及让它们变得实用的设计取舍。目标是一份用于建立方向感的稳定参考,而不是观点文章或预测。
系列
- 从第一性原理讲强化学习:十六篇笔记,从”强化学习为什么是一个独特的学习问题”出发,经过马尔可夫阶梯与 Bellman 机制,直到策略梯度的完整推导。阅读路径见系列页;PPO 及之后的内容是计划中的下一批。
计划方向
- 表示学习与嵌入
- 序列建模与注意力
- 生成式模型
- 强化学习基础(已完成到策略梯度,PPO 及之后的内容仍在计划中)
状态
上面这一整套强化学习笔记,是这里第一套完成的双语笔记。之后新增页面应当中英文一起添加。