ПочатиПочніть безкоштовно

Розв'язання 8×8 Frozen Lake за допомогою SARSA

У цій вправі ви застосуєте алгоритм SARSA, використовуючи функцію update_q_table(), яку ви раніше реалізували, щоб навчити оптимальної політики для середовища 8×8 Frozen Lake. Це середовище ідентичне класичному варіанту 4×4, відрізняється лише більшим розміром. Ви використаєте алгоритм SARSA, щоб ітеративно вдосконалювати політику агента на основі винагород, отриманих із середовища.

Q-таблицю Q уже ініціалізовано та завантажено для вас разом із функцією update_q_table() з попередньої вправи.

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інструкції до вправи

  • Для кожного епізоду тренування виконайте вибрану дію action.
  • Виберіть next_action випадково.
  • Оновіть Q-таблицю для заданих state і action.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
Редагувати та запускати код