Розв'язання 8×8 Frozen Lake за допомогою SARSA
У цій вправі ви застосуєте алгоритм SARSA, використовуючи функцію update_q_table(), яку ви раніше реалізували, щоб навчити оптимальної політики для середовища 8×8 Frozen Lake. Це середовище ідентичне класичному варіанту 4×4, відрізняється лише більшим розміром. Ви використаєте алгоритм SARSA, щоб ітеративно вдосконалювати політику агента на основі винагород, отриманих із середовища.
Q-таблицю Q уже ініціалізовано та завантажено для вас разом із функцією update_q_table() з попередньої вправи.
Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інструкції до вправи
- Для кожного епізоду тренування виконайте вибрану дію
action. - Виберіть
next_actionвипадково. - Оновіть Q-таблицю для заданих
stateіaction.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
for episode in range(num_episodes):
state, info = env.reset()
action = env.action_space.sample()
terminated = False
while not terminated:
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Choose the next action randomly
next_action = ____
# Update the Q-table
____
state, action = next_state, next_action
render_policy(get_policy())