ÎncepețiÎncepe gratuit

Calcularea randamentelor actualizate pentru strategiile agentului

Randamentele actualizate ajută la evaluarea totalului recompenselor pe care un agent le poate acumula în timp, ținând cont de faptul că recompensele viitoare sunt mai puțin valoroase decât cele imediate. Îți sunt furnizate recompensele estimate pentru două strategii diferite (exp_rewards_strategy_1 și exp_rewards_strategy_2) ale unui agent RL. Sarcina ta este să calculezi randamentul actualizat pentru fiecare strategie și să determini care dintre ele produce un randament mai mare.

Biblioteca numpy a fost deja importată pentru tine ca np.

Acest exercițiu face parte din cursul

Reinforcement Learning cu Gymnasium în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

exp_rewards_strategy_1 = np.array([3, 2, -1, 5])

discount_factor = 0.9

# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])

# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)

print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")
Editează și rulează codul