From 2513ee91ca7c010974e0cd885b37f1999e1706a0 Mon Sep 17 00:00:00 2001 From: Hongru Date: Sat, 4 Apr 2026 17:50:21 +0800 Subject: [PATCH] =?UTF-8?q?=E4=BC=98=E5=8C=96=E9=85=8D=E7=BD=AE=E6=96=87?= =?UTF-8?q?=E4=BB=B6=E6=A0=BC=E5=BC=8F=EF=BC=8C=E8=B0=83=E6=95=B4=E5=8F=82?= =?UTF-8?q?=E6=95=B0=E6=B3=A8=E9=87=8A=E5=AF=B9=E9=BD=90?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit --- configs/pendulum_config.yaml | 18 +++++++++--------- configs/ppo_pendulum_config.yaml | 24 ++++++++++++------------ 2 files changed, 21 insertions(+), 21 deletions(-) diff --git a/configs/pendulum_config.yaml b/configs/pendulum_config.yaml index e982b9c..5545a6b 100644 --- a/configs/pendulum_config.yaml +++ b/configs/pendulum_config.yaml @@ -4,16 +4,16 @@ # ========================================== # --- 算法核心参数 --- -gamma: 0.99 # 折扣因子 -tau: 0.005 # 目标网络软更新系数 (EMA) -alpha: 0.2 # 熵温度系数 -lr: 0.0003 # 学习率 (Adam, 3e-4) +gamma: 0.99 # 折扣因子 +tau: 0.005 # 目标网络软更新系数 (EMA) +alpha: 0.2 # 熵温度系数 +lr: 0.0003 # 学习率 (Adam, 3e-4) # --- 经验回放池参数 --- -buffer_size: 1000000 # 回放池最大容量 (100万条) -batch_size: 256 # 每次梯度更新抽样的 batch 大小 +buffer_size: 1000000 # 回放池最大容量 (100万条) +batch_size: 256 # 每次梯度更新抽样的 batch 大小 # --- 训练循环控制 --- -max_episodes: 200 # 总共训练多少个 episode -max_steps: 200 # 每 episode 最多步数 (Pendulum-v1 默认 200 步截断) -start_steps: 10000 # 纯随机动作探索的步数 +max_episodes: 200 # 总共训练多少个 episode +max_steps: 200 # 每 episode 最多步数 (Pendulum-v1 默认 200 步截断) +start_steps: 10000 # 纯随机动作探索的步数 diff --git a/configs/ppo_pendulum_config.yaml b/configs/ppo_pendulum_config.yaml index 7109d1b..eff60e6 100644 --- a/configs/ppo_pendulum_config.yaml +++ b/configs/ppo_pendulum_config.yaml @@ -5,21 +5,21 @@ # ========================================== # --- 算法核心参数 --- -gamma: 0.9 # 折扣因子 (Pendulum 短周期任务用 0.9 比 0.99 更易收敛) -gae_lambda: 0.95 # GAE λ (论文 Table 3) -clip_epsilon: 0.2 # 概率比率裁剪范围 [1-ε, 1+ε] -lr: 0.001 # 学习率 (PPO on-policy 更新少,适当提高 lr) +gamma: 0.9 # 折扣因子 (Pendulum 短周期任务用 0.9 比 0.99 更易收敛) +gae_lambda: 0.95 # GAE λ (论文 Table 3) +clip_epsilon: 0.2 # 概率比率裁剪范围 [1-ε, 1+ε] +lr: 0.001 # 学习率 (PPO on-policy 更新少,适当提高 lr) # --- 网络更新参数 --- -n_epochs: 10 # 每轮收集后用同一批数据重复优化的 epoch 数 -batch_size: 64 # mini-batch 大小 -vf_coef: 0.5 # 价值损失系数 c1 (公式9) -entropy_coef: 0.0 # 熵奖励系数 c2 (Pendulum 简单任务,不需要额外探索奖励) -max_grad_norm: 0.5 # 梯度裁剪上限 +n_epochs: 10 # 每轮收集后用同一批数据重复优化的 epoch 数 +batch_size: 64 # mini-batch 大小 +vf_coef: 0.5 # 价值损失系数 c1 (公式9) +entropy_coef: 0.0 # 熵奖励系数 c2 (Pendulum 简单任务,不需要额外探索奖励) +max_grad_norm: 0.5 # 梯度裁剪上限 # --- 数据收集参数 --- -steps_per_update: 1024 # 每次更新前收集的步数 (缩短到 5 个 episode 更新一次,加速学习) +steps_per_update: 1024 # 每次更新前收集的步数 (缩短到 5 个 episode 更新一次,加速学习) # --- 训练循环控制 --- -max_episodes: 500 # PPO 是 on-policy,需要更多 episode 才能收敛 -max_steps: 200 # 每 episode 最多步数 (Pendulum-v1 默认 200 步截断) +max_episodes: 500 # PPO 是 on-policy,需要更多 episode 才能收敛 +max_steps: 200 # 每 episode 最多步数 (Pendulum-v1 默认 200 步截断)