Beräkna tillståndsvärden för en policy
I samma deterministiska miljö MyGridWorld ska du nu utvärdera hur effektiv den policy är som du definierade i föregående övning. Det gör du genom att beräkna tillståndets värdefunktion för varje tillstånd under denna policy.
Miljön har importerats som env tillsammans med de variabler som behövs (terminal_state, num_states, policy, gamma).
Den här övningen är en del av kursen
Reinforcement Learning med Gymnasium i Python
Övningsinstruktioner
- Komplettera funktionen
compute_state_value()för att beräkna värdet för varje tillstånd under den givna policyn. - Skapa en ordbok
state_valuesdär varje nyckel är ettstateoch varje värde är tillståndsvärdet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Complete the function
def compute_state_value(state):
if state == terminal_state:
return ____
action = ____
_, next_state, reward, _ = env.unwrapped.P[state][action][0]
return ____
# Compute all state values
state_values = {____: ____ for ____ in range(____)}
print(state_values)