SARSA के साथ 8x8 Frozen Lake हल करना
इस अभ्यास में, आप SARSA एल्गोरिदम लागू करेंगे. आप पहले से बनाए गए update_q_table() फंक्शन को शामिल करते हुए 8x8 Frozen Lake एन्वायरनमेंट के लिए एक बेहतर पॉलिसी सीखेंगे. यह एन्वायरनमेंट क्लासिक 4x4 जैसा ही है, बस आकार में बड़ा है. आप SARSA एल्गोरिदम का उपयोग करके, एन्वायरनमेंट से मिलने वाले रिवॉर्ड्स के आधार पर एजेंट की पॉलिसी को बार-बार बेहतर करेंगे.
एक Q-table Q आपके लिए इनिशियलाइज़ करके पहले से लोड कर दी गई है, साथ ही पिछले अभ्यास का update_q_table() फंक्शन भी उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- ट्रेनिंग प्रक्रिया की हर एपिसोड में चुनी गई
actionको चलाएँ. next_actionको रैंडमली चुनें.- दिए गए
stateऔरactionके लिए Q-table अपडेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
for episode in range(num_episodes):
state, info = env.reset()
action = env.action_space.sample()
terminated = False
while not terminated:
# Execute the action
next_state, reward, terminated, truncated, info = ____
# Choose the next action randomly
next_action = ____
# Update the Q-table
____
state, action = next_state, next_action
render_policy(get_policy())