第一章 DDPG整体架构与核心思想1.1 DDPG算法简介深度确定性策略梯度(Deep Deterministic Policy Gradient,DDPG)是一种用于解决连续动作控制问题(Continuous Control Problem)的经典深度强化学习算法。DDPG属于:Actor-Critic(行动者-评价者)架构它同时学习两个不同类型的模型:策略模型(Policy Model)负责:根据当前状态决定执行什么动作。对应:Actor网络(Actor Network)数学表示:a=μθ(s)a=\mu_\theta(s)a