添加 PPO 算法实现及相关配置,更新训练入口以支持 SAC 和 PPO 模式

This commit is contained in:
2026-04-04 17:50:02 +08:00
parent f3d2d1a85f
commit a2ce5073c5
10 changed files with 675 additions and 73 deletions
-1
View File
@@ -94,7 +94,6 @@ class SAC(object):
min_q_pi = torch.min(q1_pi, q2_pi)
# 计算 Actor 的损失:最小化 (alpha * log_prob - min_Q)
# 等价于最大化 (min_Q - alpha * log_prob) -> 既要 Q 值大,又要熵大(分布广)
actor_loss = (self.alpha * log_prob - min_q_pi).mean()
# 优化 Actor 网络