Решение задачи Frozen Lake 8×8 с помощью SARSA
В этом упражнении вы применёте алгоритм SARSA вместе с функцией update_q_table(), реализованной ранее, чтобы найти оптимальную стратегию для среды Frozen Lake размером 8×8. Эта среда аналогична классической версии 4×4, но имеет больший размер. С помощью алгоритма SARSA вы будете итеративно улучшать стратегию агента на основе вознаграждений, получаемых из среды.
Q-таблица Q уже инициализирована и загружена для вас вместе с функцией update_q_table() из предыдущего упражнения.
Это упражнение является частью курса
Обучение с подкреплением с Gymnasium на Python
Инструкции к упражнению
- Для каждого эпизода в процессе обучения выполните выбранное действие
action. - Выберите
next_actionслучайным образом. - Обновите Q-таблицу для заданных
stateиaction.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
for episode in range(num_episodes):
state, info = env.reset()
action = env.action_space.sample()
terminated = False
while not terminated:
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Choose the next action randomly
next_action = ____
# Update the Q-table
____
state, action = next_state, next_action
render_policy(get_policy())