Výpočet hodnot stavů pro danou politiku
Ve stejném deterministickém prostředí MyGridWorld teď vyhodnotíš účinnost politiky, kterou jsi definoval/a v předchozím cvičení. Uděláš to výpočtem hodnotové funkce stavu pro každý stav podle této politiky.
Prostředí je importované jako env spolu s potřebnými proměnnými (terminal_state, num_states, policy, gamma).
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Pokyny k cvičení
- Dopleň funkci
compute_state_value()tak, aby počítala hodnotu každého stavu podle zadané politiky. - Vytvoř slovník
state_values, kde každý klíč odpovídá danémustatea každá hodnota odpovídá hodnotě tohoto stavu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Complete the function
def compute_state_value(state):
if state == terminal_state:
return ____
action = ____
_, next_state, reward, _ = env.unwrapped.P[state][action][0]
return ____
# Compute all state values
state_values = {____: ____ for ____ in range(____)}
print(state_values)