Améliorer une politique
Dans l'exercice précédent, vous avez calculé les valeurs Q pour chaque paire état‑action dans l'environnement MyGridWorld. Maintenant, vous utiliserez ces valeurs Q pour améliorer la politique existante. L'amélioration de la politique est une étape clé en reinforcement learning : on bonifie la politique en choisissant, pour chaque état, les actions qui maximisent l'utilité attendue (valeur Q). Après avoir amélioré la politique, vous allez afficher les nouveaux déplacements selon cette politique améliorée.
L'environnement a été importé sous le nom env, ainsi que les valeurs Q sous Q, et la fonction render().
Cette activité fait partie du cours
Reinforcement Learning avec Gymnasium en Python
Instructions de l’exercice
- Trouvez la meilleure action pour chaque état à partir des valeurs Q.
- Sélectionnez la bonne
actionselon laimproved_policy. - Exécutez l'
actionchoisie pour en observer le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
improved_policy = {}
for state in range(num_states-1):
# Find the best action for each state based on Q-values
max_action = ____
improved_policy[state] = max_action
terminated = False
while not terminated:
# Select action based on policy
action = ____
# Execute the action
state, reward, terminated, truncated, info = ____
render()