НачатьНачать бесплатно

Решение задачи Frozen Lake 8×8 с помощью SARSA

В этом упражнении вы применёте алгоритм SARSA вместе с функцией update_q_table(), реализованной ранее, чтобы найти оптимальную стратегию для среды Frozen Lake размером 8×8. Эта среда аналогична классической версии 4×4, но имеет больший размер. С помощью алгоритма SARSA вы будете итеративно улучшать стратегию агента на основе вознаграждений, получаемых из среды.

Q-таблица Q уже инициализирована и загружена для вас вместе с функцией update_q_table() из предыдущего упражнения.

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Инструкции к упражнению

  • Для каждого эпизода в процессе обучения выполните выбранное действие action.
  • Выберите next_action случайным образом.
  • Обновите Q-таблицу для заданных state и action.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
Редактировать и запускать код