ÎncepețiÎncepe gratuit

Calcularea valorilor Q

Scopul tău este să calculezi valorile de acțiune, cunoscute și sub denumirea de valori Q, pentru fiecare pereche stare-acțiune din mediul personalizat MyGridWorld, urmând politica de mai jos. În RL, valorile Q sunt esențiale deoarece reprezintă utilitatea așteptată a executării unei acțiuni specifice într-o stare dată, urmată de respectarea politicii.

exercise_policy.png

Mediul a fost importat ca env, împreună cu funcția compute_state_value() și variabilele necesare (terminal_state, num_states, num_actions, policy, gamma).

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Completează funcția compute_q_value() pentru a calcula valoarea de acțiune pentru un state și o action date.
  • Creează un dicționar Q în care fiecare cheie reprezintă o pereche stare-acțiune, iar valoarea corespunzătoare este valoarea Q pentru acea pereche.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
Editează și rulează codul