ПочатиПочніть безкоштовно

Обчислення дисконтових повернень для стратегій агента

Дисконтові повернення допомагають оцінити загальну суму винагород, яку агент може очікувати зібрати з часом, з урахуванням того, що майбутні винагороди менш цінні за негайні. Вам надано очікувані винагороди для двох різних стратегій (exp_rewards_strategy_1 і exp_rewards_strategy_2) агента RL. Ваше завдання — обчислити дисконтове повернення для кожної стратегії та визначити, яка з них дає вищий результат.

Бібліотеку numpy імпортовано для вас як np.

Ця вправа є частиною курсу

Reinforcement Learning з Gymnasium у Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

exp_rewards_strategy_1 = np.array([3, 2, -1, 5])

discount_factor = 0.9

# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])

# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)

print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")
Редагувати та запускати код