Обчислення дисконтових повернень для стратегій агента
Дисконтові повернення допомагають оцінити загальну суму винагород, яку агент може очікувати зібрати з часом, з урахуванням того, що майбутні винагороди менш цінні за негайні. Вам надано очікувані винагороди для двох різних стратегій (exp_rewards_strategy_1 і exp_rewards_strategy_2) агента RL. Ваше завдання — обчислити дисконтове повернення для кожної стратегії та визначити, яка з них дає вищий результат.
Бібліотеку numpy імпортовано для вас як np.
Ця вправа є частиною курсу
Reinforcement Learning з Gymnasium у Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
exp_rewards_strategy_1 = np.array([3, 2, -1, 5])
discount_factor = 0.9
# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])
# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)
print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")