Генерація епізодів для методів Монте-Карло
Методи Монте-Карло потребують згенерованих епізодів, щоб обчислити функцію цінності. Тому ви реалізуєте функцію, яка генерує епізоди, вибираючи дії випадково, доки епізод не завершиться. У наступних вправах ви викликатимете цю функцію, щоб застосувати методи Монте-Карло до спеціального середовища env, заздалегідь завантаженого для вас.
Функцію render() уже підготовлено для вас.
Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інструкції до вправи
- Скиньте середовище, використавши
seedзі значенням 42. - У циклі епізоду на кожній ітерації вибирайте випадкову
action. - Після завершення ітерації оновіть дані
episode, додавши кортеж(state, action, reward).
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())