НачатьНачать бесплатно

Генерация эпизодов для методов Монте-Карло

Методы Монте-Карло требуют генерации эпизодов для вычисления функции ценности. В этом упражнении вы реализуете функцию, которая генерирует эпизоды, выбирая действия случайным образом до завершения эпизода. В последующих упражнениях вы будете вызывать эту функцию для применения методов Монте-Карло к заранее загруженной пользовательской среде env.

Функция render() уже загружена для вас.

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Инструкции к упражнению

  • Сбросьте среду, используя seed равным 42.
  • В цикле эпизода выбирайте случайное действие action на каждой итерации.
  • После завершения итерации обновите данные episode, добавив кортеж (state, action, reward).

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
Редактировать и запускать код