शुरू करेंमुफ़्त में शुरू करें

नीति में सुधार

पिछले अभ्यास में, आपने MyGridWorld environment में प्रत्येक state-action जोड़ी के लिए Q-values निकाले थे. अब, आप इन Q-values का उपयोग करके मौजूदा policy में सुधार करेंगे. Policy improvement, reinforcement learning का एक महत्त्वपूर्ण चरण है जिसमें आप हर state में वह action चुनते हैं जो अपेक्षित उपयोगिता (Q-value) को अधिकतम करे. नीति में सुधार करने के बाद, आप इसी सुधरी हुई policy के अनुसार नए मूवमेंट्स को render करेंगे.

Environment env के रूप में, Q-values Q के रूप में, और render() फंक्शन के साथ इम्पोर्ट कर दिए गए हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Q-values के आधार पर प्रत्येक state के लिए सबसे अच्छी action ढूँढ़ें.
  • improved_policy के आधार पर सही action चुनें.
  • चुनी गई action को निष्पादित करें और उसका परिणाम देखें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

improved_policy = {}

for state in range(num_states-1):
    # Find the best action for each state based on Q-values
    max_action = ____
    improved_policy[state] = max_action

terminated = False
while not terminated:
  # Select action based on policy 
  action = ____
  # Execute the action
  state, reward, terminated, truncated, info = ____
  render()
कोड संपादित करें और चलाएँ