楔子:用连续的函数代替离散的状态价值表。
计算简便,且可能具有更好的泛化性,当然会不可避免地损失部分信息。
可以用梯度下降求解最优的价值函数。这里可以对状态的分布做不同的假设(如均匀分布,马尔科夫链的平稳分布)。进一步去掉期望化为随机梯度下降。然后可以通过MC或者TD算法进行求解。
对于价值函数的选择,可以用非线性的神经网络,也可以用线性函数(对参数线性,而不是说对s线性),线性函数简单,但是表示能力有限,且需要选择合适的状态特征向量。
TD-linear以及Least Squared TD
可以对Sarsa和Q-learning做修改以直接估计动作价值函数
深度Q-learning,即DQN。