1. TD算法在强化学习中的核心定位1.1 TD到底是什么TD,全称Temporal-Difference Learning,时序差分学习。理解 TD 最重要的一点是:TD并不是一个与DQN、PPO、SAC完全同层级的单一现代强化学习算法,而是一类利用“当前估计 + 下一时刻估计”构造学习目标的价值学习方法。它回答的核心问题是:如何利用一段尚未结束的经验,更新当前的价值估计? \boxed{\text{如何利用一段尚未结束的经验,更新当前的价值估计?}}