Episodgenerering för Monte Carlo-metoder
Monte Carlo-metoder kräver att episoder genereras för att värdefunktionen ska kunna härledas. Därför ska du nu implementera en funktion som genererar episoder genom att välja åtgärder slumpmässigt tills en episod avslutas. I senare övningar kommer du att anropa den här funktionen för att tillämpa Monte Carlo-metoder på den anpassade miljön env, som redan är inläst åt dig.
Funktionen render() är redan inläst åt dig.
Den här övningen är en del av kursen
Reinforcement Learning med Gymnasium i Python
Övningsinstruktioner
- Återställ miljön med ett
seed-värde på 42. - I episodloopen väljer du en slumpmässig
actionvid varje iteration. - När en iteration är klar, uppdaterar du
episode-datan genom att lägga till tupeln(state, action, reward).
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())