Генерация эпизодов для методов Монте-Карло
Методы Монте-Карло требуют генерации эпизодов для вычисления функции ценности. В этом упражнении вы реализуете функцию, которая генерирует эпизоды, выбирая действия случайным образом до завершения эпизода. В последующих упражнениях вы будете вызывать эту функцию для применения методов Монте-Карло к заранее загруженной пользовательской среде env.
Функция render() уже загружена для вас.
Это упражнение является частью курса
Обучение с подкреплением с Gymnasium на Python
Инструкции к упражнению
- Сбросьте среду, используя
seedравным 42. - В цикле эпизода выбирайте случайное действие
actionна каждой итерации. - После завершения итерации обновите данные
episode, добавив кортеж(state, action, reward).
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())