शुरू करेंमुफ़्त में शुरू करें

एजेंट स्ट्रैटेजी के लिए डिस्काउंटेड रिटर्न निकालना

डिस्काउंटेड रिटर्न यह आकलन करने में मदद करता है कि समय के साथ कोई एजेंट कुल कितने रिवॉर्ड जुटा सकता है, यह मानते हुए कि भविष्य के रिवॉर्ड, तात्कालिक रिवॉर्ड की तुलना में कम मूल्यवान होते हैं। आपको एक RL एजेंट की दो अलग-अलग स्ट्रैटेजी (exp_rewards_strategy_1 और exp_rewards_strategy_2) के अपेक्षित रिवॉर्ड दिए गए हैं। आपका काम प्रत्येक स्ट्रैटेजी का डिस्काउंटेड रिटर्न निकालना और यह तय करना है कि किसका रिटर्न ज़्यादा है।

numpy लाइब्रेरी आपके लिए np नाम से इम्पोर्ट की गई है।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

exp_rewards_strategy_1 = np.array([3, 2, -1, 5])

discount_factor = 0.9

# Compute discounts
discounts_strategy_1 = np.array([____ for i in range(len(exp_rewards_strategy_1))])

# Compute the discounted return
discounted_return_strategy_1 = np.sum(____)

print(f"The discounted return of the first strategy is {discounted_return_strategy_1}")
कोड संपादित करें और चलाएँ