Kom igångKom igång gratis

Episodgenerering för Monte Carlo-metoder

Monte Carlo-metoder kräver att episoder genereras för att värdefunktionen ska kunna härledas. Därför ska du nu implementera en funktion som genererar episoder genom att välja åtgärder slumpmässigt tills en episod avslutas. I senare övningar kommer du att anropa den här funktionen för att tillämpa Monte Carlo-metoder på den anpassade miljön env, som redan är inläst åt dig.

Funktionen render() är redan inläst åt dig.

Den här övningen är en del av kursen

Reinforcement Learning med Gymnasium i Python

Visa kurs

Övningsinstruktioner

  • Återställ miljön med ett seed-värde på 42.
  • I episodloopen väljer du en slumpmässig action vid varje iteration.
  • När en iteration är klar, uppdaterar du episode-datan genom att lägga till tupeln (state, action, reward).

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
Redigera och kör kod