Résoudre CliffWalking avec la stratégie epsilon-greedy
L'environnement CliffWalking est un banc d'essai standard pour les algorithmes de RL. C'est un monde en grille où un agent doit trouver un chemin d'un état de départ à un état objectif, en évitant les falaises sur son trajet. L'utilisation de la stratégie epsilon-greedy permet à l'agent d'explorer efficacement l'environnement tout en apprenant à éviter les falaises, ce qui maximise la récompense cumulative. Votre tâche consiste à résoudre cet environnement avec la stratégie epsilon-greedy, à calculer les récompenses obtenues à chaque épisode d'entraînement et à les enregistrer dans la liste rewards_eps_greedy.
Cette activité fait partie du cours
Reinforcement Learning avec Gymnasium en Python
Instructions de l’exercice
- À l'intérieur d'un épisode, sélectionnez une
actionen utilisant la fonctionepsilon_greedy(). - Additionnez la
rewardreçue àepisode_reward. - Après chaque épisode, ajoutez la somme
episode_rewardà la listerewards_eps_greedypour l'analyse ultérieure.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
rewards_eps_greedy = []
for episode in range(total_episodes):
state, info = env.reset()
episode_reward = 0
for i in range(max_steps):
# Select action with epsilon-greedy strategy
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
# Accumulate reward
____
update_q_table(state, action, reward, next_state)
state = next_state
# Append the toal reward to the rewards list
____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))