用于 Monte Carlo 方法的回合生成
Monte Carlo 方法需要先生成回合,才能推导价值函数。因此,您现在将实现一个函数:通过随机选择动作,直到回合结束,用于生成回合。后续练习中,您会调用此函数,将 Monte Carlo 方法应用到已为您预加载的自定义环境 env。
render() 函数已为您预加载。
本练习是课程的一部分
Python 中的 Gymnasium 强化学习
练习说明
- 使用
seed为 42 重置环境。 - 在回合循环中,每次迭代选择一个随机的
action。 - 每次迭代结束后,将元组
(state, action, reward)添加到episode,以更新回合数据。
交互式实操练习
通过完成这段示例代码来试试这个练习。
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())