Kom igångKom igång gratis

Beräkna tillståndsvärden för en policy

I samma deterministiska miljö MyGridWorld ska du nu utvärdera hur effektiv den policy är som du definierade i föregående övning. Det gör du genom att beräkna tillståndets värdefunktion för varje tillstånd under denna policy.

Miljön har importerats som env tillsammans med de variabler som behövs (terminal_state, num_states, policy, gamma).

Den här övningen är en del av kursen

Reinforcement Learning med Gymnasium i Python

Visa kurs

Övningsinstruktioner

  • Komplettera funktionen compute_state_value() för att beräkna värdet för varje tillstånd under den givna policyn.
  • Skapa en ordbok state_values där varje nyckel är ett state och varje värde är tillståndsvärdet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Complete the function
def compute_state_value(state):
    if state == terminal_state:
        return ____
    action = ____
    _, next_state, reward, _ = env.unwrapped.P[state][action][0]
    return ____

# Compute all state values 
state_values = {____: ____ for ____ in range(____)}

print(state_values)
Redigera och kör kod