नीति में सुधार
पिछले अभ्यास में, आपने MyGridWorld environment में प्रत्येक state-action जोड़ी के लिए Q-values निकाले थे. अब, आप इन Q-values का उपयोग करके मौजूदा policy में सुधार करेंगे. Policy improvement, reinforcement learning का एक महत्त्वपूर्ण चरण है जिसमें आप हर state में वह action चुनते हैं जो अपेक्षित उपयोगिता (Q-value) को अधिकतम करे. नीति में सुधार करने के बाद, आप इसी सुधरी हुई policy के अनुसार नए मूवमेंट्स को render करेंगे.
Environment env के रूप में, Q-values Q के रूप में, और render() फंक्शन के साथ इम्पोर्ट कर दिए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- Q-values के आधार पर प्रत्येक state के लिए सबसे अच्छी action ढूँढ़ें.
improved_policyके आधार पर सहीactionचुनें.- चुनी गई
actionको निष्पादित करें और उसका परिणाम देखें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
improved_policy = {}
for state in range(num_states-1):
# Find the best action for each state based on Q-values
max_action = ____
improved_policy[state] = max_action
terminated = False
while not terminated:
# Select action based on policy
action = ____
# Execute the action
state, reward, terminated, truncated, info = ____
render()