Porównywanie polityk
Masz do dyspozycji dwie funkcje wartości stanów (value_function_1 i value_function_2) odpowiadające dwóm różnym politykom w środowisku MyGridWorld. Twoim zadaniem jest porównanie tych funkcji wartości stan po stanie, aby określić, która polityka jest skuteczniejsza.
Możesz korzystać ze zmiennej num_states.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Instrukcje do ćwiczenia
- Utwórz listę
one_is_betterwartości logicznych, gdzie każdy element sprawdza, czy wartość danego stanu wvalue_function_1jest większa lub równa wartości tego stanu wvalue_function_2. - Utwórz listę
two_is_betterwartości logicznych, gdzie każdy element sprawdza, czy wartość danego stanu wvalue_function_2jest większa lub równa wartości tego stanu wvalue_function_1.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
value_function_1 = {0: 1, 1: 2, 2: 3, 3: 7, 4: 6, 5: 4, 6: 8, 7: 10, 8: 0}
value_function_2 = {0: 7, 1: 8, 2: 9, 3: 7, 4: 9, 5: 10, 6: 8, 7: 10, 8: 0}
# Check for each value in policy 1 if it is better than policy 2
one_is_better = [____ >= ____ for state in range(num_states)]
# Check for each value in policy 2 if it is better than policy 1
two_is_better = [____ >= ____ for state in range(num_states)]
if all(one_is_better):
print("Policy 1 is better.")
elif all(two_is_better):
print("Policy 2 is better.")
else:
print("Neither policy is uniformly better across all states.")