CommencezCommencez gratuitement

Calcul des valeurs Q

Votre objectif est de calculer les valeurs d'action, aussi appelées valeurs Q, pour chaque paire état–action dans l'environnement personnalisé MyGridWorld en suivant la politique ci-dessous. En RL, les valeurs Q sont essentielles, car elles représentent l'utilité anticipée d'exécuter une action précise dans un état donné, puis de suivre la politique.

exercise_policy.png

L'environnement a été importé sous le nom env, en plus de la fonction compute_state_value() et des variables nécessaires (terminal_state, num_states, num_actions, policy, gamma).

Cette activité fait partie du cours

Reinforcement Learning avec Gymnasium en Python

Voir le cours

Instructions de l’exercice

  • Complétez la fonction compute_q_value() pour calculer la valeur d'action pour un state et une action donnés.
  • Créez un dictionnaire Q où chaque clé représente une paire état–action, et la valeur correspondante est la valeur Q de cette paire.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
Modifier et exécuter le code