CommencezCommencez gratuitement

Génération d'épisodes pour les méthodes de Monte-Carlo

Les méthodes de Monte-Carlo exigent la génération d'épisodes afin d'en déduire la fonction de valeur. Vous allez donc implémenter une fonction qui génère des épisodes en sélectionnant des actions au hasard jusqu'à la fin de l'épisode. Dans les exercices suivants, vous appellerez cette fonction pour appliquer les méthodes de Monte-Carlo sur l'environnement personnalisé env préchargé pour vous.

La fonction render() est déjà chargée pour vous.

Cette activité fait partie du cours

Reinforcement Learning avec Gymnasium en Python

Voir le cours

Instructions de l’exercice

  • Réinitialisez l'environnement en utilisant une seed de 42.
  • Dans la boucle d'épisode, sélectionnez une action aléatoire à chaque itération.
  • À la fin de chaque itération, mettez à jour les données de episode en ajoutant le triplet (state, action, reward).

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
Modifier et exécuter le code