Zacznij terazZacznij za darmo

Obliczanie zdyskontowanych zwrotów dla strategii agenta

Zdyskontowane zwroty pomagają ocenić łączną sumę nagród, jaką agent może zgromadzić w czasie – przy założeniu, że przyszłe nagrody są mniej wartościowe niż te natychmiastowe. Masz do dyspozycji oczekiwane nagrody dla dwóch różnych strategii agenta RL (exp_rewards_strategy_1 i exp_rewards_strategy_2). Twoim zadaniem jest obliczenie zdyskontowanego zwrotu dla każdej strategii i ustalenie, która z nich przynosi wyższy zwrot.

Biblioteka numpy została już zaimportowana jako np.

To ćwiczenie jest częścią kursu

Uczenie przez wzmacnianie z Gymnasium w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

exp_rewards_strategy_1 = np.array([3, 2, -1, 5])

discount_factor = 0.9

# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])

# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)

print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")
Edytuj i uruchom kod