CommencezCommencez gratuitement

Résoudre Frozen Lake 8x8 avec SARSA

Dans cet exercice, vous allez appliquer l'algorithme SARSA, en intégrant la fonction update_q_table() que vous avez déjà implantée, pour apprendre une politique optimale dans l'environnement Frozen Lake 8x8. Cet environnement est identique au classique 4x4, à la seule différence qu'il est plus grand. Vous utiliserez l'algorithme SARSA pour améliorer itérativement la politique de l'agent en fonction des récompenses reçues de l'environnement.

Une table Q Q a été initialisée et préchargée pour vous, ainsi que la fonction update_q_table() de l'exercice précédent.

Cette activité fait partie du cours

Reinforcement Learning avec Gymnasium en Python

Voir le cours

Instructions de l’exercice

  • Pour chaque épisode du processus d'entraînement, exécutez l'action choisie.
  • Choisissez next_action au hasard.
  • Mettez à jour la table Q pour le state et l'action donnés.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
Modifier et exécuter le code