{ "cells": [ { "cell_type": "markdown", "id": "f6b663c9", "metadata": {}, "source": [ "# 第 1 章:强化学习基本概念 (Basic Concepts)\n", "本笔记本旨在复现 3x3 网格世界中的基础马尔可夫决策过程 (MDP) 元素。" ] }, { "cell_type": "code", "execution_count": 1, "id": "6771d846", "metadata": {}, "outputs": [ { "name": "stdout", "output_type": "stream", "text": [ "状态空间大小: 9\n", "动作空间大小: 5\n" ] } ], "source": [ "# 定义状态空间 (9个格子)\n", "states = [\"s1\", \"s2\", \"s3\", \"s4\", \"s5\", \"s6\", \"s7\", \"s8\", \"s9\"]\n", "\n", "# 定义动作空间 (5种动作)\n", "actions = [\"a1\", \"a2\", \"a3\", \"a4\", \"a5\"] # 分别代表:上、右、下、左、原地\n", "\n", "print(f\"状态空间大小: {len(states)}\")\n", "print(f\"动作空间大小: {len(actions)}\")" ] }, { "cell_type": "code", "execution_count": 4, "id": "20ed6dce", "metadata": {}, "outputs": [ { "name": "stdout", "output_type": "stream", "text": [ "在 s1 采取动作 a2,下一个状态是: s2\n" ] } ], "source": [ "# 构建状态转移字典,格式:(当前状态, 动作): 下一个状态\n", "transitions = {}\n", "\n", "# s1 的转移\n", "transitions[(\"s1\", \"a1\")] = \"s1\" # 向上撞墙,反弹回 s1\n", "transitions[(\"s1\", \"a2\")] = \"s2\" # 向右进入 s2\n", "transitions[(\"s1\", \"a3\")] = \"s4\" # 向下进入 s4\n", "transitions[(\"s1\", \"a4\")] = \"s1\" # 向左撞墙,反弹回 s1\n", "transitions[(\"s1\", \"a5\")] = \"s1\" # 原地不动\n", "\n", "# s2 的转移\n", "transitions[(\"s2\", \"a1\")] = \"s2\" # 向上撞墙,反弹回 s2\n", "transitions[(\"s2\", \"a2\")] = \"s3\" # 向右进入 s3\n", "transitions[(\"s2\", \"a3\")] = \"s5\" # 向下进入 s5\n", "transitions[(\"s2\", \"a4\")] = \"s1\" # 向左进入 s1\n", "transitions[(\"s2\", \"a5\")] = \"s2\" # 原地不动\n", "\n", "# s3 的转移\n", "transitions[(\"s3\", \"a1\")] = \"s3\" # 向上撞墙\n", "transitions[(\"s3\", \"a2\")] = \"s3\" # 向右撞墙\n", "transitions[(\"s3\", \"a3\")] = \"s6\" # 向下进入 s6\n", "transitions[(\"s3\", \"a4\")] = \"s2\" # 向左进入 s2\n", "transitions[(\"s3\", \"a5\")] = \"s3\" # 原地不动\n", "\n", "# s4 的转移\n", "transitions[(\"s4\", \"a1\")] = \"s1\" # 向上进入 s1\n", "transitions[(\"s4\", \"a2\")] = \"s5\" # 向右进入 s5\n", "transitions[(\"s4\", \"a3\")] = \"s7\" # 向下进入 s7\n", "transitions[(\"s4\", \"a4\")] = \"s4\" # 向左撞墙\n", "transitions[(\"s4\", \"a5\")] = \"s4\" # 原地不动\n", "\n", "# s5 的转移\n", "transitions[(\"s5\", \"a1\")] = \"s2\" # 向上进入 s2\n", "transitions[(\"s5\", \"a2\")] = \"s6\" # 向右进入 s6\n", "transitions[(\"s5\", \"a3\")] = \"s8\" # 向下进入 s8\n", "transitions[(\"s5\", \"a4\")] = \"s4\" # 向左进入 s4\n", "transitions[(\"s5\", \"a5\")] = \"s5\" # 原地不动\n", "\n", "# s6 的转移\n", "transitions[(\"s6\", \"a1\")] = \"s3\" # 向上进入 s3\n", "transitions[(\"s6\", \"a2\")] = \"s6\" # 向右撞墙\n", "transitions[(\"s6\", \"a3\")] = \"s9\" # 向下进入 s9\n", "transitions[(\"s6\", \"a4\")] = \"s5\" # 向左进入 s5\n", "transitions[(\"s6\", \"a5\")] = \"s6\" # 原地不动\n", "\n", "# s7 的转移\n", "transitions[(\"s7\", \"a1\")] = \"s4\" # 向上进入 s4\n", "transitions[(\"s7\", \"a2\")] = \"s8\" # 向右进入 s8\n", "transitions[(\"s7\", \"a3\")] = \"s7\" # 向下撞墙\n", "transitions[(\"s7\", \"a4\")] = \"s7\" # 向左撞墙\n", "transitions[(\"s7\", \"a5\")] = \"s7\" # 原地不动\n", "\n", "# s8 的转移\n", "transitions[(\"s8\", \"a1\")] = \"s5\" # 向上进入 s5\n", "transitions[(\"s8\", \"a2\")] = \"s9\" # 向右进入 s9\n", "transitions[(\"s8\", \"a3\")] = \"s8\" # 向下撞墙\n", "transitions[(\"s8\", \"a4\")] = \"s7\" # 向左进入 s7\n", "transitions[(\"s8\", \"a5\")] = \"s8\" # 原地不动\n", "\n", "# s9 的转移\n", "transitions[(\"s9\", \"a1\")] = \"s6\" # 向上进入 s6\n", "transitions[(\"s9\", \"a2\")] = \"s9\" # 向右撞墙\n", "transitions[(\"s9\", \"a3\")] = \"s9\" # 向下撞墙\n", "transitions[(\"s9\", \"a4\")] = \"s8\" # 向左进入 s8\n", "transitions[(\"s9\", \"a5\")] = \"s9\" # 原地不动\n", "\n", "def get_next_state(state, action):\n", " return transitions.get((state, action), state) # 如果没定义,默认原地不动\n", "\n", "print(f\"在 s1 采取动作 a2,下一个状态是: {get_next_state('s1', 'a2')}\")" ] }, { "cell_type": "code", "execution_count": 5, "id": "788f4de0", "metadata": {}, "outputs": [ { "name": "stdout", "output_type": "stream", "text": [ "s1撞墙奖励: -1\n", "进入目标s9奖励: 1\n" ] } ], "source": [ "# 定义奖励规则\n", "def get_reward(state, action, next_state):\n", " # 如果撞墙(当前状态和下一个状态一样,且不是原地动作)\n", " if state == next_state and action != \"a5\":\n", " return -1\n", " # 如果进入目标状态 s9\n", " elif next_state == \"s9\":\n", " return 1\n", " # 如果进入禁区 s6 或 s7 (根据书中图 1.2)\n", " elif next_state in [\"s6\", \"s7\"]:\n", " return -1\n", " # 其他情况\n", " else:\n", " return 0\n", "\n", "# 测试一下\n", "test_r1 = get_reward(\"s1\", \"a1\", \"s1\")\n", "test_r2 = get_reward(\"s8\", \"a2\", \"s9\")\n", "print(f\"s1撞墙奖励: {test_r1}\") # 应该输出 -1\n", "print(f\"进入目标s9奖励: {test_r2}\") # 应该输出 1" ] }, { "cell_type": "code", "execution_count": 8, "id": "c64e665e", "metadata": {}, "outputs": [ { "name": "stdout", "output_type": "stream", "text": [ "--- 运行轨迹并计算回报 ---\n", "Step 0: s1 --a2--> s2, Reward: 0\n", "Step 1: s2 --a3--> s5, Reward: 0\n", "Step 2: s5 --a3--> s8, Reward: 0\n", "Step 3: s8 --a2--> s9, Reward: 1\n", "最终折扣回报: 0.7290000000000001\n" ] } ], "source": [ "# 定义一条书中的轨迹 (图 1.6 左侧的好策略轨迹)\n", "# 格式:[(状态, 动作), ...]\n", "good_trajectory = [\n", " (\"s1\", \"a2\"), (\"s2\", \"a3\"), (\"s5\", \"a3\"), (\"s8\", \"a2\")\n", "]\n", "\n", "# 计算回报的函数\n", "def calculate_discounted_return(trajectory, gamma=0.9):\n", " total_return = 0.0\n", " \n", " for t, (state, action) in enumerate(trajectory):\n", " next_state = get_next_state(state, action)\n", " reward = get_reward(state, action, next_state)\n", " \n", " # 计算折扣回报\n", " total_return += (gamma ** t) * reward\n", " print(f\"Step {t}: {state} --{action}--> {next_state}, Reward: {reward}\")\n", " \n", " return total_return\n", "\n", "print(\"--- 运行轨迹并计算回报 ---\")\n", "final_return = calculate_discounted_return(good_trajectory, gamma=0.9)\n", "print(f\"最终折扣回报: {final_return}\")" ] }, { "cell_type": "markdown", "id": "5de54db1", "metadata": {}, "source": [ "接下来来有一些随机策略的case" ] }, { "cell_type": "code", "execution_count": 9, "id": "6b05c85f", "metadata": {}, "outputs": [ { "name": "stdout", "output_type": "stream", "text": [ "在状态 s1 进行 10 次动作选择测试:\n", "[np.str_('a2'), np.str_('a2'), np.str_('a2'), np.str_('a2'), np.str_('a3'), np.str_('a3'), np.str_('a3'), np.str_('a3'), np.str_('a2'), np.str_('a3')]\n", "向右(a2)的次数: 5, 向下(a3)的次数: 5\n" ] } ], "source": [ "import numpy as np\n", "\n", "# 定义一个随机策略字典\n", "# 格式:状态: {动作: 概率, 动作: 概率}\n", "stochastic_policy = {\n", " \"s1\": {\"a2\": 0.5, \"a3\": 0.5}, # 图 1.5 中的设定\n", " \"s2\": {\"a3\": 1.0}, # 其他状态假设是确定性的 100%\n", " \"s5\": {\"a3\": 1.0},\n", " \"s8\": {\"a2\": 1.0}\n", "}\n", "\n", "def choose_action(state, policy):\n", " # 如果策略里有这个状态的动作概率分布\n", " if state in policy:\n", " action_probs = policy[state]\n", " actions = list(action_probs.keys())\n", " probs = list(action_probs.values())\n", " # 根据概率分布随机选择一个动作\n", " chosen_action = np.random.choice(actions, p=probs)\n", " return chosen_action\n", " else:\n", " return \"a5\" # 默认原地不动\n", "\n", "# 测试随机策略:让智能体在 s1 连续做 10 次决定\n", "print(\"在状态 s1 进行 10 次动作选择测试:\")\n", "choices = [choose_action(\"s1\", stochastic_policy) for _ in range(10)]\n", "print(choices)\n", "print(f\"向右(a2)的次数: {choices.count('a2')}, 向下(a3)的次数: {choices.count('a3')}\")" ] } ], "metadata": { "kernelspec": { "display_name": "GymRL", "language": "python", "name": "python3" }, "language_info": { "codemirror_mode": { "name": "ipython", "version": 3 }, "file_extension": ".py", "mimetype": "text/x-python", "name": "python", "nbconvert_exporter": "python", "pygments_lexer": "ipython3", "version": "3.13.9" } }, "nbformat": 4, "nbformat_minor": 5 }