Začněte nyníZačněte zdarma

Výpočet diskontovaných výnosů pro strategie agenta

Diskontované výnosy pomáhají vyhodnotit celkové odměny, které agent může v průběhu času nashromáždit – s přihlédnutím k tomu, že budoucí odměny mají nižší hodnotu než odměny okamžité. Máš k dispozici očekávané odměny pro dvě různé strategie (exp_rewards_strategy_1 a exp_rewards_strategy_2) RL agenta. Tvým úkolem je vypočítat diskontovaný výnos pro každou strategii a určit, která z nich přináší vyšší výnos.

Knihovna numpy je už naimportovaná jako np.

Toto cvičení je součástí kurzu

Reinforcement Learning with Gymnasium in Python

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

exp_rewards_strategy_1 = np.array([3, 2, -1, 5])

discount_factor = 0.9

# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])

# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)

print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")
Upravit a spustit kód