Monte Carlo methods के लिए एपिसोड जनरेशन
Monte Carlo methods में वैल्यू फंक्शन निकालने के लिए एपिसोड जनरेट करने पड़ते हैं. इसलिए, अब आप एक फंक्शन इम्प्लीमेंट करेंगे जो रैंडमली एक्शन चुनते हुए तब तक चलता है जब तक एपिसोड खत्म न हो जाए. अगले अभ्यासों में, आप इसी फंक्शन को कॉल करके आपके लिए प्रीलोड किए गए कस्टम एनवायरनमेंट env पर Monte Carlo methods लागू करेंगे.
render() फंक्शन आपके लिए पहले से लोड है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
seed= 42 का उपयोग करके एनवायरनमेंट रीसेट करें.- एपिसोड लूप में, हर इटरेशन पर एक रैंडम
actionचुनें. - जब एक इटरेशन समाप्त हो जाए, तो
(state, action, reward)ट्यूपल जोड़करepisodeडेटा अपडेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
def generate_episode():
episode = []
# Reset the environment
state, info = ____
terminated = False
while not terminated:
# Select a random action
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
render()
# Update episode data
episode.____(____)
state = next_state
return episode
print(generate_episode())