开始使用免费开始使用

改进策略

在上一个练习中,您已经为 MyGridWorld 环境中的每个状态-动作对计算了 Q 值。现在,您将使用这些 Q 值来改进已有的策略。策略改进是强化学习中的关键步骤,即在每个状态中选择能使期望效用(Q 值)最大的动作,从而提升策略。完成改进后,您将根据改进后的策略渲染新的移动路径。

环境已作为 env 导入,Q 值为 Q,并提供了 render() 函数。

本练习是课程的一部分

Python 中的 Gymnasium 强化学习

查看课程

练习说明

  • 基于 Q 值为每个状态找到最优动作。
  • 基于 improved_policy 选择正确的 action
  • 执行所选 action 并观察其结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

improved_policy = {}

for state in range(num_states-1):
    # Find the best action for each state based on Q-values
    max_action = ____
    improved_policy[state] = max_action

terminated = False
while not terminated:
  # Select action based on policy 
  action = ____
  # Execute the action
  state, reward, terminated, truncated, info = ____
  render()
编辑并运行代码