CommencezCommencez gratuitement

Améliorer une politique

Dans l'exercice précédent, vous avez calculé les valeurs Q pour chaque paire état‑action dans l'environnement MyGridWorld. Maintenant, vous utiliserez ces valeurs Q pour améliorer la politique existante. L'amélioration de la politique est une étape clé en reinforcement learning : on bonifie la politique en choisissant, pour chaque état, les actions qui maximisent l'utilité attendue (valeur Q). Après avoir amélioré la politique, vous allez afficher les nouveaux déplacements selon cette politique améliorée.

L'environnement a été importé sous le nom env, ainsi que les valeurs Q sous Q, et la fonction render().

Cette activité fait partie du cours

Reinforcement Learning avec Gymnasium en Python

Voir le cours

Instructions de l’exercice

  • Trouvez la meilleure action pour chaque état à partir des valeurs Q.
  • Sélectionnez la bonne action selon la improved_policy.
  • Exécutez l'action choisie pour en observer le résultat.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

improved_policy = {}

for state in range(num_states-1):
    # Find the best action for each state based on Q-values
    max_action = ____
    improved_policy[state] = max_action

terminated = False
while not terminated:
  # Select action based on policy 
  action = ____
  # Execute the action
  state, reward, terminated, truncated, info = ____
  render()
Modifier et exécuter le code