ÎncepețiÎncepe gratuit

Compararea politicilor

Ți se oferă două funcții de valoare a stărilor (value_function_1 și value_function_2) corespunzătoare a două politici diferite în mediul MyGridWorld. Sarcina ta este să compari aceste funcții de valoare stare cu stare, pentru a determina care politică este mai eficientă.

Variabila num_states îți este disponibilă pentru a o folosi.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează o listă one_is_better de valori booleene, în care fiecare element verifică dacă valoarea stării din value_function_1 este mai mare sau egală cu valoarea stării din value_function_2.
  • Creează o listă two_is_better de valori booleene, în care fiecare element verifică dacă valoarea stării din value_function_2 este mai mare sau egală cu valoarea stării din value_function_1.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

value_function_1 = {0: 1, 1: 2, 2: 3, 3: 7, 4: 6, 5: 4, 6: 8, 7: 10, 8: 0}
value_function_2 = {0: 7, 1: 8, 2: 9, 3: 7, 4: 9, 5: 10, 6: 8, 7: 10, 8: 0}

# Check for each value in policy 1 if it is better than policy 2
one_is_better = [____ >= ____ for state in range(num_states)]

# Check for each value in policy 2 if it is better than policy 1
two_is_better = [____ >= ____ for state in range(num_states)]

if all(one_is_better):
  print("Policy 1 is better.")
elif all(two_is_better):
  print("Policy 2 is better.")
else:
  print("Neither policy is uniformly better across all states.")
Editează și rulează codul