开始使用免费开始使用

使用 SARSA 解决 8x8 Frozen Lake

在本练习中,您将应用 SARSA 算法,并结合您之前实现的 update_q_table() 函数,为 8x8 Frozen Lake 环境学习一个最优策略。该环境与经典的 4x4 版本相同,唯一的区别是规模更大。您将使用 SARSA 算法,基于从环境获得的回报,不断迭代改进智能体的策略。

我们已经为您初始化并预加载了一个 Q 表 Q,以及上一个练习中的 update_q_table() 函数。

本练习是课程的一部分

Python 中的 Gymnasium 强化学习

查看课程

练习说明

  • 在训练过程的每个 episode 中执行选定的 action
  • 随机选择 next_action
  • 为给定的 stateaction 更新 Q 表。

交互式实操练习

通过完成这段示例代码来试试这个练习。

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
编辑并运行代码