DETERMINISTIC POLICY WORKBENCH

先别背公式,
看清谁在向谁学习。

DDPG 有四个网络,但真正接收梯度的只有两个在线网络。 选择一个步骤,观察信息、梯度和参数分别怎样移动。

STEP 01 · EXPERIENCE

环境交互:先收集经验

01 / 06
环境经验
环境
经验回放池
A₁ ONLINE

在线 Actor

μθ(s)

根据状态选择动作
梯度更新 θ
参数 θ······→τ 慢速跟随
A₂ TARGET

目标 Actor

μθ′(s′)

为下一状态给出稳定动作
不接收梯度
C₁ ONLINE

在线 Critic

Qϕ(s,a)

评价当前动作值多少
梯度更新 ϕ
参数 ϕ······→τ 慢速跟随
C₂ TARGET

目标 Critic

Qϕ′(s′,a′)

提供稳定的未来价值
不接收梯度
Critic 评分 Qϕ(s, μθ(s)) Actor 调整动作

在线 Actor 与环境交互,产生的经验进入回放池。

01

在线 Actor 读取状态 s,输出动作 a;环境返回奖励 r 和下一状态 s′,经验被存进回放池。

FORMULA PLAYGROUND

拖动数字,亲眼看见“损失”

公式不是装饰。每个旋钮都对应训练批次中的一个量。

01 / CRITIC 监督式回归

预测值离 TD 目标有多远?

LQ = ( − [ + ])²
TD 目标 y3.70
距离 Q−y−2.20
平方损失 LQ4.84

Critic 的答案有“标准答案”:由奖励和两个目标网络共同拼出的 TD 目标。

02 / ACTOR 策略爬坡

没有标签,只让 Critic 打更高分

Lπ = − E[ ( s, )]
当前动作
−1 +1 Critic 偏好的高分区
Critic 给出的 Q1.53
Actor 损失 −Q−1.53

梯度会推动动作向右,靠近更高分区域。

Actor 不拟合某个“正确动作”,它借 Critic 的斜率寻找更高分的位置。

03 / TARGET 参数低通滤波

目标网络一步跟多少?

θ′ ← (1−)θ′ +
−20+2 旧目标 在线 新目标
更新后的目标参数 −0.40

只走完两者距离的 5.0%

目标网络不拟合奖励;它直接在参数空间里跟随在线网络。

NEXT MODULE

理解 DDPG 后,
再看 SAC 多了什么。

确定性动作随机策略 单 Q 网络双 Q 抑制高估 只追求回报回报 + 熵