ÎncepețiÎncepe gratuit

Calcularea valorilor de stare pentru o politică

Folosind același mediu determinist MyGridWorld, trebuie acum să evaluezi eficiența politicii definite în exercițiul anterior. Vei face acest lucru calculând funcția de valoare a stării pentru fiecare stare sub această politică.

Mediul a fost importat ca env, împreună cu variabilele necesare (terminal_state, num_states, policy, gamma).

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Completează funcția compute_state_value() pentru a calcula valoarea fiecărei stări sub politica dată.
  • Creează un dicționar state_values în care fiecare cheie este state, iar fiecare valoare este valoarea stării respective.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Complete the function
def compute_state_value(state):
    if state == terminal_state:
        return ____
    action = ____
    _, next_state, reward, _ = env.unwrapped.P[state][action][0]
    return ____

# Compute all state values 
state_values = {____: ____ for ____ in range(____)}

print(state_values)
Editează și rulează codul