शुरू करेंमुफ़्त में शुरू करें

epsilon-greedy स्ट्रैटेजी से CliffWalking को सुलझाना

CliffWalking एनवायरनमेंट RL एल्गोरिदम के लिए एक मानक टेस्टबेड है. यह एक grid world है जहाँ एजेंट को start state से goal state तक पहुँचना होता है और रास्ते में आने वाली cliffs से बचना होता है. epsilon-greedy स्ट्रैटेजी का उपयोग करने से एजेंट एनवायरनमेंट को प्रभावी ढंग से explore कर पाता है, cliffs से बचना सीखता है, और cumulative reward को अधिकतम करता है. आपका कार्य है कि आप इस एनवायरनमेंट को epsilon-greedy स्ट्रैटेजी से सुलझाएँ, प्रत्येक training episode में प्राप्त rewards की गणना करें, और उन्हें rewards_eps_greedy सूची में सेव करें.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • हर episode के अंदर, epsilon_greedy() फंक्शन का उपयोग करके एक action चुनें.
  • प्राप्त हुए reward को episode_reward में जोड़ते जाएँ.
  • प्रत्येक episode के बाद, कुल episode_reward को बाद के विश्लेषण के लिए rewards_eps_greedy सूची में जोड़ें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

rewards_eps_greedy = []
for episode in range(total_episodes):
    state, info = env.reset()
    episode_reward = 0
    for i in range(max_steps):
      	# Select action with epsilon-greedy strategy
        action = ____
        next_state, reward, terminated, truncated, info = env.step(action)
        # Accumulate reward
        ____        
        update_q_table(state, action, reward, next_state)      
        state = next_state
    # Append the toal reward to the rewards list 
    ____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))
कोड संपादित करें और चलाएँ