НачатьНачать бесплатно

Вычисление дисконтированных доходов для стратегий агента

Дисконтированные доходы помогают оценить суммарное вознаграждение, которое агент может накопить со временем, учитывая, что будущие вознаграждения менее ценны, чем немедленные. Вам даны ожидаемые вознаграждения для двух различных стратегий (exp_rewards_strategy_1 и exp_rewards_strategy_2) агента в задаче обучения с подкреплением. Ваша задача — вычислить дисконтированный доход для каждой стратегии и определить, какая из них даёт более высокий результат.

Библиотека numpy уже импортирована как np.

Это упражнение является частью курса

Обучение с подкреплением с Gymnasium на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

exp_rewards_strategy_1 = np.array([3, 2, -1, 5])

discount_factor = 0.9

# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])

# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)

print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")
Редактировать и запускать код