ÎncepețiÎncepe gratuit

Generarea episoadelor pentru metodele Monte Carlo

Metodele Monte Carlo necesită generarea de episoade pentru a deriva funcția de valoare. Prin urmare, vei implementa acum o funcție care generează episoade selectând acțiuni aleatoriu până când un episod se încheie. În exercițiile următoare, vei apela această funcție pentru a aplica metodele Monte Carlo pe mediul personalizat env, preîncărcat pentru tine.

Funcția render() este preîncărcată pentru tine.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Resetează mediul folosind un seed cu valoarea 42.
  • În bucla episodului, selectează o action aleatoare la fiecare iterație.
  • Odată ce o iterație se încheie, actualizează datele episode adăugând tupla (state, action, reward).

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
Editează și rulează codul