शुरू करेंमुफ़्त में शुरू करें

Monte Carlo methods के लिए एपिसोड जनरेशन

Monte Carlo methods में वैल्यू फंक्शन निकालने के लिए एपिसोड जनरेट करने पड़ते हैं. इसलिए, अब आप एक फंक्शन इम्प्लीमेंट करेंगे जो रैंडमली एक्शन चुनते हुए तब तक चलता है जब तक एपिसोड खत्म न हो जाए. अगले अभ्यासों में, आप इसी फंक्शन को कॉल करके आपके लिए प्रीलोड किए गए कस्टम एनवायरनमेंट env पर Monte Carlo methods लागू करेंगे.

render() फंक्शन आपके लिए पहले से लोड है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • seed = 42 का उपयोग करके एनवायरनमेंट रीसेट करें.
  • एपिसोड लूप में, हर इटरेशन पर एक रैंडम action चुनें.
  • जब एक इटरेशन समाप्त हो जाए, तो (state, action, reward) ट्यूपल जोड़कर episode डेटा अपडेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

def generate_episode():
    episode = []
    # Reset the environment
    state, info = ____
    terminated = False
    while not terminated:
      # Select a random action
      action = ____
      next_state, reward, terminated, truncated, info = env.step(action)
      render()
      # Update episode data
      episode.____(____)
      state = next_state
    return episode
print(generate_episode())
कोड संपादित करें और चलाएँ