添加 PPO 算法实现及相关配置,更新训练入口以支持 SAC 和 PPO 模式
This commit is contained in:
@@ -94,7 +94,6 @@ class SAC(object):
|
||||
min_q_pi = torch.min(q1_pi, q2_pi)
|
||||
|
||||
# 计算 Actor 的损失:最小化 (alpha * log_prob - min_Q)
|
||||
# 等价于最大化 (min_Q - alpha * log_prob) -> 既要 Q 值大,又要熵大(分布广)
|
||||
actor_loss = (self.alpha * log_prob - min_q_pi).mean()
|
||||
|
||||
# 优化 Actor 网络
|
||||
|
||||
Reference in New Issue
Block a user