A₁
ONLINE
在线 Actor
μθ(s)
根据状态选择动作梯度更新 θ
DETERMINISTIC POLICY WORKBENCH
DDPG 有四个网络,但真正接收梯度的只有两个在线网络。 选择一个步骤,观察信息、梯度和参数分别怎样移动。
STEP 01 · EXPERIENCE
在线 Actor
目标 Actor
在线 Critic
目标 Critic
在线 Actor 与环境交互,产生的经验进入回放池。
在线 Actor 读取状态 s,输出动作 a;环境返回奖励 r 和下一状态 s′,经验被存进回放池。
FORMULA PLAYGROUND
公式不是装饰。每个旋钮都对应训练批次中的一个量。
Critic 的答案有“标准答案”:由奖励和两个目标网络共同拼出的 TD 目标。
梯度会推动动作向右,靠近更高分区域。
Actor 不拟合某个“正确动作”,它借 Critic 的斜率寻找更高分的位置。
只走完两者距离的 5.0%
目标网络不拟合奖励;它直接在参数空间里跟随在线网络。
MODULE 02 · ADVANCED
DDPG 学会了“沿 Critic 的坡向上走”。SAC 再加入随机策略、双 Critic 和熵温度 α。
这不是考试,而是为了让后面的每一个差异都有参照物。
ENTROPY TEMPERATURE
α 越大,随机性得到的奖励越多;α 越小,策略越专注于 Critic 认为最好的动作。