Generarea episoadelor pentru metodele Monte Carlo
Metodele Monte Carlo necesită generarea de episoade pentru a deriva funcția de valoare. Prin urmare, vei implementa acum o funcție care generează episoade selectând acțiuni aleatoriu până când un episod se încheie. În exercițiile următoare, vei apela această funcție pentru a aplica metodele Monte Carlo pe mediul personalizat env, preîncărcat pentru tine.
Funcția render() este preîncărcată pentru tine.
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Instrucțiuni pentru exercițiu
- Resetează mediul folosind un
seedcu valoarea 42. - În bucla episodului, selectează o
actionaleatoare la fiecare iterație. - Odată ce o iterație se încheie, actualizează datele
episodeadăugând tupla(state, action, reward).
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())