Decayed epsilon-greedy स्ट्रैटेजी से CliffWalking हल करना
Epsilon-greedy स्ट्रैटेजी को बेहतर बनाने के लिए, एक decay फैक्टर जोड़ा जाता है ताकि जैसे-जैसे एजेंट एनवायरनमेंट के बारे में सीखता है, exploration रेट epsilon धीरे-धीरे घटे. यह तरीका सीखने की शुरुआती अवस्था में exploration को बढ़ावा देता है और जब एजेंट एनवायरनमेंट से परिचित हो जाता है, तो सीखे हुए ज्ञान का exploitation करवाता है. अब, आप इस स्ट्रैटेजी को CliffWalking एनवायरनमेंट हल करने में लागू करेंगे.
एनवायरनमेंट इनिशियलाइज़ कर दिया गया है और वैरिएबल env से उपलब्ध है. वैरिएबल epsilon, min_epsilon, और epsilon_decay आपके लिए पहले से परिभाषित हैं. फंक्शन epsilon_greedy() और update_q_table() इम्पोर्ट किए जा चुके हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- पूरा ट्रेनिंग लूप इम्प्लीमेंट करें: कोई
actionचुनें, उसे चलाएँ, मिलने वालेrewardकोepisode_rewardमें जोड़ें, और Q-टेबल अपडेट करें. epsilon_decayरेट का उपयोग करकेepsilonघटाएँ, यह सुनिश्चित करते हुए कि यहmin_epsilonसे नीचे न जाए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
rewards_decay_eps_greedy = []
for episode in range(total_episodes):
state, info = env.reset()
episode_reward = 0
for i in range(max_steps):
# Implement the training loop
action = ____
new_state, reward, terminated, truncated, info = ____
episode_reward += ____
____
state = new_state
rewards_decay_eps_greedy.append(episode_reward)
# Update epsilon
epsilon = ____
print("Average reward per episode: ", np.mean(rewards_decay_eps_greedy))