epsilon-greedy स्ट्रैटेजी से CliffWalking को सुलझाना
CliffWalking एनवायरनमेंट RL एल्गोरिदम के लिए एक मानक टेस्टबेड है. यह एक grid world है जहाँ एजेंट को start state से goal state तक पहुँचना होता है और रास्ते में आने वाली cliffs से बचना होता है. epsilon-greedy स्ट्रैटेजी का उपयोग करने से एजेंट एनवायरनमेंट को प्रभावी ढंग से explore कर पाता है, cliffs से बचना सीखता है, और cumulative reward को अधिकतम करता है. आपका कार्य है कि आप इस एनवायरनमेंट को epsilon-greedy स्ट्रैटेजी से सुलझाएँ, प्रत्येक training episode में प्राप्त rewards की गणना करें, और उन्हें rewards_eps_greedy सूची में सेव करें.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- हर episode के अंदर,
epsilon_greedy()फंक्शन का उपयोग करके एकactionचुनें. - प्राप्त हुए
rewardकोepisode_rewardमें जोड़ते जाएँ. - प्रत्येक episode के बाद, कुल
episode_rewardको बाद के विश्लेषण के लिएrewards_eps_greedyसूची में जोड़ें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
rewards_eps_greedy = []
for episode in range(total_episodes):
state, info = env.reset()
episode_reward = 0
for i in range(max_steps):
# Select action with epsilon-greedy strategy
action = ____
next_state, reward, terminated, truncated, info = env.step(action)
# Accumulate reward
____
update_q_table(state, action, reward, next_state)
state = next_state
# Append the toal reward to the rewards list
____
print("Average reward per episode: ", np.mean(rewards_eps_greedy))