Files
RL_SAC/configs/pendulum_config.yaml
T
2026-04-04 15:51:08 +08:00

23 lines
1.1 KiB
YAML

# ==========================================
# Soft Actor-Critic (SAC) - Pendulum-v1 配置
# ==========================================
# --- 算法核心参数 ---
gamma: 0.99 # 折扣因子 (越接近1越看重长期收益)
tau: 0.005 # 目标网络软更新系数 (EMA平滑系数,越小越稳定)
alpha: 0.2 # 熵温度系数 (控制探索力度,Pendulum中0.2比较合适,如果是复杂环境可能需要调整或自动学习)
lr: 0.0003 # 学习率 (Actor 和 Critic 保持一致,3e-4 是 Adam 优化器的万金油)
# --- 经验回放池参数 ---
buffer_size: 1000000 # 回放池最大容量 (100万条)
batch_size: 256 # 每次梯度更新抽样的 batch 大小
# --- 训练循环控制 ---
max_episodes: 200 # 总共训练多少个回合 (Episode)
max_steps: 200 # 每个回合最多走多少步 (Gym Pendulum 默认 200 步截断)
start_steps: 10000 # 纯随机动作探索的步数 (用来快速填补经验池的高多样性数据)
# --- 扩展参数 (为了后续画图和保存模型备用) ---
eval_freq: 10 # 每隔多少个回合评估一次策略
save_model: true # 是否保存最终模型权重