शुरू करेंमुफ़्त में शुरू करें

Expected SARSA लागू करना

अब आप Expected SARSA एल्गोरिदम को नीचे दिखाए गए एक कस्टम environment में लागू करेंगे, जहाँ लक्ष्य है कि एक agent ग्रिड में रास्ता बनाते हुए जितनी जल्दी हो सके goal तक पहुँचे. पहले जैसे ही नियम लागू हैं: एजेंट को डायमंड तक पहुँचने पर +10 का रिवॉर्ड मिलता है, पहाड़ (mountain) से गुजरने पर -2, और हर अन्य state के लिए -1.

new_cust_env.png

environment को env के रूप में import किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • हर state-action जोड़ी के लिए Q-टेबल Q को शून्य से initialize करें.
  • Q-टेबल को update_q_table() फंक्शन का उपयोग करके अपडेट करें.
  • सीखी गई Q-टेबल से policy को एक dictionary के रूप में निकालें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Initialize the Q-table with random values
Q = ____
for i_episode in range(num_episodes):
    state, info = env.reset()    
    done = False    
    while not done: 
        action = env.action_space.sample()               
        next_state, reward, done, truncated, info = env.step(action)
        # Update the Q-table
        ____
        state = next_state
# Derive policy from Q-table        
policy = {state: ____ for state in range(____)}
render_policy(policy)
कोड संपादित करें और चलाएँ