Výpočet diskontovaných výnosů pro strategie agenta
Diskontované výnosy pomáhají vyhodnotit celkové odměny, které agent může v průběhu času nashromáždit – s přihlédnutím k tomu, že budoucí odměny mají nižší hodnotu než odměny okamžité. Máš k dispozici očekávané odměny pro dvě různé strategie (exp_rewards_strategy_1 a exp_rewards_strategy_2) RL agenta. Tvým úkolem je vypočítat diskontovaný výnos pro každou strategii a určit, která z nich přináší vyšší výnos.
Knihovna numpy je už naimportovaná jako np.
Toto cvičení je součástí kurzu
Reinforcement Learning with Gymnasium in Python
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
exp_rewards_strategy_1 = np.array([3, 2, -1, 5])
discount_factor = 0.9
# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])
# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)
print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")