目标

这个 collection 用来整理人工智能的事实性笔记:模型家族的发展史、催生它们的问题,以及让它们变得实用的设计取舍。目标是一份用于建立方向感的稳定参考,而不是观点文章或预测。

系列

  • 从第一性原理讲强化学习:十六篇笔记,从”强化学习为什么是一个独特的学习问题”出发,经过马尔可夫阶梯与 Bellman 机制,直到策略梯度的完整推导。阅读路径见系列页;PPO 及之后的内容是计划中的下一批。

计划方向

  • 表示学习与嵌入
  • 序列建模与注意力
  • 生成式模型
  • 强化学习基础(已完成到策略梯度,PPO 及之后的内容仍在计划中)

状态

上面这一整套强化学习笔记,是这里第一套完成的双语笔记。之后新增页面应当中英文一起添加。