开始使用免费开始使用

用于 Monte Carlo 方法的回合生成

Monte Carlo 方法需要先生成回合,才能推导价值函数。因此,您现在将实现一个函数:通过随机选择动作,直到回合结束,用于生成回合。后续练习中,您会调用此函数,将 Monte Carlo 方法应用到已为您预加载的自定义环境 env

render() 函数已为您预加载。

本练习是课程的一部分

Python 中的 Gymnasium 强化学习

查看课程

练习说明

  • 使用 seed 为 42 重置环境。
  • 在回合循环中,每次迭代选择一个随机的 action
  • 每次迭代结束后,将元组 (state, action, reward) 添加到 episode,以更新回合数据。

交互式实操练习

通过完成这段示例代码来试试这个练习。

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
编辑并运行代码