Kom igångKom igång gratis

Beräkna diskonterade avkastningar för agentstrategier

Diskonterad avkastning hjälper till att utvärdera den totala mängden belöningar som en agent kan förväntas samla in över tid, med hänsyn till att framtida belöningar är mindre värdefulla än omedelbara belöningar. Du får de förväntade belöningarna för två olika strategier (exp_rewards_strategy_1 och exp_rewards_strategy_2) för en RL-agent. Din uppgift är att beräkna den diskonterade avkastningen för varje strategi och avgöra vilken som ger högst avkastning.

Biblioteket numpy har importerats åt dig som np.

Den här övningen är en del av kursen

Reinforcement Learning med Gymnasium i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

exp_rewards_strategy_1 = np.array([3, 2, -1, 5])

discount_factor = 0.9

# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])

# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)

print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")
Redigera och kör kod