CommencezCommencez gratuitement

Résoudre CliffWalking avec la stratégie epsilon-greedy

L'environnement CliffWalking est un banc d'essai standard pour les algorithmes de RL. C'est un monde en grille où un agent doit trouver un chemin d'un état de départ à un état objectif, en évitant les falaises sur son trajet. L'utilisation de la stratégie epsilon-greedy permet à l'agent d'explorer efficacement l'environnement tout en apprenant à éviter les falaises, ce qui maximise la récompense cumulative. Votre tâche consiste à résoudre cet environnement avec la stratégie epsilon-greedy, à calculer les récompenses obtenues à chaque épisode d'entraînement et à les enregistrer dans la liste rewards_eps_greedy.

Cette activité fait partie du cours

Reinforcement Learning avec Gymnasium en Python

Voir le cours

Instructions de l’exercice

  • À l'intérieur d'un épisode, sélectionnez une action en utilisant la fonction epsilon_greedy().
  • Additionnez la reward reçue à episode_reward.
  • Après chaque épisode, ajoutez la somme episode_reward à la liste rewards_eps_greedy pour l'analyse ultérieure.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

rewards_eps_greedy = []
for episode in range(total_episodes):
    state, info = env.reset()
    episode_reward = 0
    for i in range(max_steps):
      	# Select action with epsilon-greedy strategy
        action = ____
        next_state, reward, terminated, truncated, info = env.step(action)
        # Accumulate reward
        ____        
        update_q_table(state, action, reward, next_state)      
        state = next_state
    # Append the toal reward to the rewards list 
    ____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))
Modifier et exécuter le code