Začněte nyníZačněte zdarma

Generování epizod pro metody Monte Carlo

Metody Monte Carlo potřebují ke zjištění hodnotové funkce generovat epizody. Teď proto napíšeš funkci, která epizody generuje tak, že náhodně vybírá akce, dokud epizoda neskončí. V dalších cvičeních tuto funkci použiješ k aplikaci metod Monte Carlo na vlastní prostředí env, které je pro tebe předem připravené.

Funkce render() je také předem připravená.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • Resetuj prostředí s hodnotou seed 42.
  • Ve smyčce epizody vyber v každé iteraci náhodnou action.
  • Po skončení iterace aktualizuj data episode přidáním trojice (state, action, reward).

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
Upravit a spustit kód