Začněte nyníZačněte zdarma

Výpočet hodnot stavů pro danou politiku

Ve stejném deterministickém prostředí MyGridWorld teď vyhodnotíš účinnost politiky, kterou jsi definoval/a v předchozím cvičení. Uděláš to výpočtem hodnotové funkce stavu pro každý stav podle této politiky.

Prostředí je importované jako env spolu s potřebnými proměnnými (terminal_state, num_states, policy, gamma).

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • Dopleň funkci compute_state_value() tak, aby počítala hodnotu každého stavu podle zadané politiky.
  • Vytvoř slovník state_values, kde každý klíč odpovídá danému state a každá hodnota odpovídá hodnotě tohoto stavu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Complete the function
def compute_state_value(state):
    if state == terminal_state:
        return ____
    action = ____
    _, next_state, reward, _ = env.unwrapped.P[state][action][0]
    return ____

# Compute all state values 
state_values = {____: ____ for ____ in range(____)}

print(state_values)
Upravit a spustit kód