Expected SARSA लागू करना
अब आप Expected SARSA एल्गोरिदम को नीचे दिखाए गए एक कस्टम environment में लागू करेंगे, जहाँ लक्ष्य है कि एक agent ग्रिड में रास्ता बनाते हुए जितनी जल्दी हो सके goal तक पहुँचे. पहले जैसे ही नियम लागू हैं: एजेंट को डायमंड तक पहुँचने पर +10 का रिवॉर्ड मिलता है, पहाड़ (mountain) से गुजरने पर -2, और हर अन्य state के लिए -1.

environment को env के रूप में import किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- हर state-action जोड़ी के लिए Q-टेबल
Qको शून्य से initialize करें. - Q-टेबल को
update_q_table()फंक्शन का उपयोग करके अपडेट करें. - सीखी गई Q-टेबल से policy को एक dictionary के रूप में निकालें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Initialize the Q-table with random values
Q = ____
for i_episode in range(num_episodes):
state, info = env.reset()
done = False
while not done:
action = env.action_space.sample()
next_state, reward, done, truncated, info = env.step(action)
# Update the Q-table
____
state = next_state
# Derive policy from Q-table
policy = {state: ____ for state in range(____)}
render_policy(policy)