# ========================================== # Soft Actor-Critic (SAC) # Pendulum-v1 配置 # ========================================== # --- 算法核心参数 --- gamma: 0.99 # 折扣因子 tau: 0.005 # 目标网络软更新系数 (EMA) alpha: 0.2 # 熵温度系数 lr: 0.0003 # 学习率 (Adam, 3e-4) # --- 经验回放池参数 --- buffer_size: 1000000 # 回放池最大容量 (100万条) batch_size: 256 # 每次梯度更新抽样的 batch 大小 # --- 训练循环控制 --- max_episodes: 200 # 总共训练多少个 episode max_steps: 200 # 每 episode 最多步数 (Pendulum-v1 默认 200 步截断) start_steps: 3000 # 纯随机动作探索的步数