शुरू करेंमुफ़्त में शुरू करें

Expected SARSA अपडेट नियम

इस अभ्यास में, आप Expected SARSA अपडेट नियम इम्प्लीमेंट करेंगे, जो एक temporal difference मॉडल-फ्री RL एल्गोरिदम है. Expected SARSA, सभी संभावित actions पर औसत लेकर वर्तमान पॉलिसी के expected value का अनुमान लगाता है, जिससे SARSA की तुलना में अधिक स्थिर अपडेट टार्गेट मिलता है. Expected SARSA में उपयोग होने वाले फॉर्मूले नीचे दिए गए हैं.

Image showing the mathematical formula of the expected SARSA update rule.

numpy लाइब्रेरी को np नाम से इम्पोर्ट किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • next_state के लिए expected Q-value निकालें.
  • Expected SARSA फॉर्मूला का उपयोग करके वर्तमान state और action का Q-value अपडेट करें.
  • Q-table Q को अपडेट करें, मान लीजिए एजेंट state 2 में action 1 लेता है और state 3 पर चला जाता है, और उसे 5 का रिवॉर्ड मिलता है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

def update_q_table(state, action, next_state, reward):
  	# Calculate the expected Q-value for the next state
    expected_q = ____
    # Update the Q-value for the current state and action
    Q[state, action] = ____
    
Q = np.random.rand(5, 2)
print("Old Q:\n", Q)
alpha = 0.1
gamma = 0.99

# Update the Q-table
update_q_table(____, ____, ____, ____)
print("Updated Q:\n", Q)
कोड संपादित करें और चलाएँ