Obliczanie zdyskontowanych zwrotów dla strategii agenta
Zdyskontowane zwroty pomagają ocenić łączną sumę nagród, jaką agent może zgromadzić w czasie – przy założeniu, że przyszłe nagrody są mniej wartościowe niż te natychmiastowe. Masz do dyspozycji oczekiwane nagrody dla dwóch różnych strategii agenta RL (exp_rewards_strategy_1 i exp_rewards_strategy_2). Twoim zadaniem jest obliczenie zdyskontowanego zwrotu dla każdej strategii i ustalenie, która z nich przynosi wyższy zwrot.
Biblioteka numpy została już zaimportowana jako np.
To ćwiczenie jest częścią kursu
Uczenie przez wzmacnianie z Gymnasium w Pythonie
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
exp_rewards_strategy_1 = np.array([3, 2, -1, 5])
discount_factor = 0.9
# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])
# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)
print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")