使用 SARSA 解决 8x8 Frozen Lake
在本练习中,您将应用 SARSA 算法,并结合您之前实现的 update_q_table() 函数,为 8x8 Frozen Lake 环境学习一个最优策略。该环境与经典的 4x4 版本相同,唯一的区别是规模更大。您将使用 SARSA 算法,基于从环境获得的回报,不断迭代改进智能体的策略。
我们已经为您初始化并预加载了一个 Q 表 Q,以及上一个练习中的 update_q_table() 函数。
本练习是课程的一部分
Python 中的 Gymnasium 强化学习
练习说明
- 在训练过程的每个 episode 中执行选定的
action。 - 随机选择
next_action。 - 为给定的
state和action更新 Q 表。
交互式实操练习
通过完成这段示例代码来试试这个练习。
for episode in range(num_episodes):
state, info = env.reset()
action = env.action_space.sample()
terminated = False
while not terminated:
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Choose the next action randomly
next_action = ____
# Update the Q-table
____
state, action = next_state, next_action
render_policy(get_policy())