ПочатиПочніть безкоштовно

Генерація епізодів для методів Монте-Карло

Методи Монте-Карло потребують згенерованих епізодів, щоб обчислити функцію цінності. Тому ви реалізуєте функцію, яка генерує епізоди, вибираючи дії випадково, доки епізод не завершиться. У наступних вправах ви викликатимете цю функцію, щоб застосувати методи Монте-Карло до спеціального середовища env, заздалегідь завантаженого для вас.

Функцію render() уже підготовлено для вас.

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інструкції до вправи

  • Скиньте середовище, використавши seed зі значенням 42.
  • У циклі епізоду на кожній ітерації вибирайте випадкову action.
  • Після завершення ітерації оновіть дані episode, додавши кортеж (state, action, reward).

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
Редагувати та запускати код