Calcularea valorilor Q
Scopul tău este să calculezi valorile de acțiune, cunoscute și sub denumirea de valori Q, pentru fiecare pereche stare-acțiune din mediul personalizat MyGridWorld, urmând politica de mai jos. În RL, valorile Q sunt esențiale deoarece reprezintă utilitatea așteptată a executării unei acțiuni specifice într-o stare dată, urmată de respectarea politicii.

Mediul a fost importat ca env, împreună cu funcția compute_state_value() și variabilele necesare (terminal_state, num_states, num_actions, policy, gamma).
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Instrucțiuni pentru exercițiu
- Completează funcția
compute_q_value()pentru a calcula valoarea de acțiune pentru unstateși oactiondate. - Creează un dicționar
Qîn care fiecare cheie reprezintă o pereche stare-acțiune, iar valoarea corespunzătoare este valoarea Q pentru acea pereche.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
if state == terminal_state:
return None
probability, next_state, reward, done = ____
return ____
# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}
print(Q)