Začněte nyníZačněte zdarma

Porovnání politik

Máš k dispozici dvě stavové hodnotové funkce (value_function_1 a value_function_2), které odpovídají dvěma různým politikám v prostředí MyGridWorld. Tvým úkolem je porovnat tyto stavové hodnotové funkce stav po stavu a zjistit, která politika je efektivnější.

Proměnná num_states je připravena k použití.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř seznam one_is_better s booleovskými hodnotami, kde každý prvek ověřuje, zda je hodnota daného stavu ve value_function_1 větší nebo rovna hodnotě téhož stavu ve value_function_2.
  • Vytvoř seznam two_is_better s booleovskými hodnotami, kde každý prvek ověřuje, zda je hodnota daného stavu ve value_function_2 větší nebo rovna hodnotě téhož stavu ve value_function_1.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

value_function_1 = {0: 1, 1: 2, 2: 3, 3: 7, 4: 6, 5: 4, 6: 8, 7: 10, 8: 0}
value_function_2 = {0: 7, 1: 8, 2: 9, 3: 7, 4: 9, 5: 10, 6: 8, 7: 10, 8: 0}

# Check for each value in policy 1 if it is better than policy 2
one_is_better = [____ >= ____ for state in range(num_states)]

# Check for each value in policy 2 if it is better than policy 1
two_is_better = [____ >= ____ for state in range(num_states)]

if all(one_is_better):
  print("Policy 1 is better.")
elif all(two_is_better):
  print("Policy 2 is better.")
else:
  print("Neither policy is uniformly better across all states.")
Upravit a spustit kód