Generování epizod pro metody Monte Carlo
Metody Monte Carlo potřebují ke zjištění hodnotové funkce generovat epizody. Teď proto napíšeš funkci, která epizody generuje tak, že náhodně vybírá akce, dokud epizoda neskončí. V dalších cvičeních tuto funkci použiješ k aplikaci metod Monte Carlo na vlastní prostředí env, které je pro tebe předem připravené.
Funkce render() je také předem připravená.
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Pokyny k cvičení
- Resetuj prostředí s hodnotou
seed42. - Ve smyčce epizody vyber v každé iteraci náhodnou
action. - Po skončení iterace aktualizuj data
episodepřidáním trojice(state, action, reward).
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())