Calcularea valorilor de stare pentru o politică
Folosind același mediu determinist MyGridWorld, trebuie acum să evaluezi eficiența politicii definite în exercițiul anterior. Vei face acest lucru calculând funcția de valoare a stării pentru fiecare stare sub această politică.
Mediul a fost importat ca env, împreună cu variabilele necesare (terminal_state, num_states, policy, gamma).
Acest exercițiu face parte din cursul
Reinforcement Learning cu Gymnasium în Python
Instrucțiuni pentru exercițiu
- Completează funcția
compute_state_value()pentru a calcula valoarea fiecărei stări sub politica dată. - Creează un dicționar
state_valuesîn care fiecare cheie estestate, iar fiecare valoare este valoarea stării respective.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Complete the function
def compute_state_value(state):
if state == terminal_state:
return ____
action = ____
_, next_state, reward, _ = env.unwrapped.P[state][action][0]
return ____
# Compute all state values
state_values = {____: ____ for ____ in range(____)}
print(state_values)