Beräkna diskonterade avkastningar för agentstrategier
Diskonterad avkastning hjälper till att utvärdera den totala mängden belöningar som en agent kan förväntas samla in över tid, med hänsyn till att framtida belöningar är mindre värdefulla än omedelbara belöningar. Du får de förväntade belöningarna för två olika strategier (exp_rewards_strategy_1 och exp_rewards_strategy_2) för en RL-agent. Din uppgift är att beräkna den diskonterade avkastningen för varje strategi och avgöra vilken som ger högst avkastning.
Biblioteket numpy har importerats åt dig som np.
Den här övningen är en del av kursen
Reinforcement Learning med Gymnasium i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
exp_rewards_strategy_1 = np.array([3, 2, -1, 5])
discount_factor = 0.9
# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])
# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)
print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")