शुरू करेंमुफ़्त में शुरू करें

SARSA के साथ 8x8 Frozen Lake हल करना

इस अभ्यास में, आप SARSA एल्गोरिदम लागू करेंगे. आप पहले से बनाए गए update_q_table() फंक्शन को शामिल करते हुए 8x8 Frozen Lake एन्वायरनमेंट के लिए एक बेहतर पॉलिसी सीखेंगे. यह एन्वायरनमेंट क्लासिक 4x4 जैसा ही है, बस आकार में बड़ा है. आप SARSA एल्गोरिदम का उपयोग करके, एन्वायरनमेंट से मिलने वाले रिवॉर्ड्स के आधार पर एजेंट की पॉलिसी को बार-बार बेहतर करेंगे.

एक Q-table Q आपके लिए इनिशियलाइज़ करके पहले से लोड कर दी गई है, साथ ही पिछले अभ्यास का update_q_table() फंक्शन भी उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • ट्रेनिंग प्रक्रिया की हर एपिसोड में चुनी गई action को चलाएँ.
  • next_action को रैंडमली चुनें.
  • दिए गए state और action के लिए Q-table अपडेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

for episode in range(num_episodes):
    state, info = env.reset()
    action = env.action_space.sample()
    terminated = False
    while not terminated:
      	# Execute the action
        next_state, reward, terminated, truncated, info = ____
        # Choose the next action randomly
        next_action = ____
        # Update the Q-table
        ____
        state, action = next_state, next_action   
render_policy(get_policy())
कोड संपादित करें और चलाएँ