शुरू करेंमुफ़्त में शुरू करें

ऑप्टिमल पॉलिसी के लिए पॉलिसी इटरेशन लागू करना

पॉलिसी इटरेशन, RL में ऑप्टिमल पॉलिसी खोजने की एक बुनियादी तकनीक है। इसमें दो मुख्य चरण होते हैं: पॉलिसी इवैल्युएशन, जहाँ किसी दी गई पॉलिसी के लिए स्टेट-वैल्यू फंक्शन निकाला जाता है, और पॉलिसी इम्प्रूवमेंट, जहाँ इन्हीं मूल्यों के आधार पर पॉलिसी अपडेट की जाती है। आप इन चरणों को बार-बार लागू करेंगे ताकि कस्टम MyGridWorld एनवायरनमेंट में ऑप्टिमल पॉलिसी तक कन्वर्जेंस हो सके।

render_policy() फंक्शन किसी पॉलिसी के अनुसार एजेंट द्वारा लिए गए स्टेप्स को दिखाने के लिए इस्तेमाल होगा।

compute_state_value(state, policy) और compute_q_value(state, action, policy) आपके लिए पहले से प्रीलोडेड हैं।

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Complete the policy evaluation function
def policy_evaluation(policy):
    V = {____: ____ for ____ in range(____)}
    return V
कोड संपादित करें और चलाएँ