शुरू करेंमुफ़्त में शुरू करें

Decayed epsilon-greedy स्ट्रैटेजी से CliffWalking हल करना

Epsilon-greedy स्ट्रैटेजी को बेहतर बनाने के लिए, एक decay फैक्टर जोड़ा जाता है ताकि जैसे-जैसे एजेंट एनवायरनमेंट के बारे में सीखता है, exploration रेट epsilon धीरे-धीरे घटे. यह तरीका सीखने की शुरुआती अवस्था में exploration को बढ़ावा देता है और जब एजेंट एनवायरनमेंट से परिचित हो जाता है, तो सीखे हुए ज्ञान का exploitation करवाता है. अब, आप इस स्ट्रैटेजी को CliffWalking एनवायरनमेंट हल करने में लागू करेंगे.

एनवायरनमेंट इनिशियलाइज़ कर दिया गया है और वैरिएबल env से उपलब्ध है. वैरिएबल epsilon, min_epsilon, और epsilon_decay आपके लिए पहले से परिभाषित हैं. फंक्शन epsilon_greedy() और update_q_table() इम्पोर्ट किए जा चुके हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • पूरा ट्रेनिंग लूप इम्प्लीमेंट करें: कोई action चुनें, उसे चलाएँ, मिलने वाले reward को episode_reward में जोड़ें, और Q-टेबल अपडेट करें.
  • epsilon_decay रेट का उपयोग करके epsilon घटाएँ, यह सुनिश्चित करते हुए कि यह min_epsilon से नीचे न जाए.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

rewards_decay_eps_greedy = []
for episode in range(total_episodes):
    state, info = env.reset()
    episode_reward = 0
    for i in range(max_steps):
      	# Implement the training loop
        action = ____
        new_state, reward, terminated, truncated, info = ____
        episode_reward += ____       
        ____      
        state = new_state
    rewards_decay_eps_greedy.append(episode_reward)
    # Update epsilon
    epsilon = ____
print("Average reward per episode: ", np.mean(rewards_decay_eps_greedy))
कोड संपादित करें और चलाएँ