西湖大学强化学习笔记
学习西湖大学强化学习课程/教材的读书笔记,涵盖强化学习基础、策略梯度、Actor-Critic 等核心内容。
笔记列表
- 随机近似 — Robbins-Monro 算法、收敛性条件等随机近似基础内容
- 价值函数 — 函数逼近、梯度下降求解价值函数、DQN
- 策略梯度 — 策略参数化、指标选择、Reinforce 算法
- 第 1–2 讲:强化学习基本概念与贝尔曼方程 — PDF 讲义,5 页
- 第 3 讲:最优状态价值与贝尔曼最优方程 — PDF 讲义,9 页
- 第 4 讲:值迭代与策略迭代 — PDF 讲义,11 页
- 第 5 讲:蒙特卡洛方法 — PDF 讲义,11 页
- 第 6 讲:随机近似 — PDF 讲义,13 页
- TD 算法 — Q-learning、Sarsa、on-policy 与 off-policy