Expected SARSA अपडेट नियम
इस अभ्यास में, आप Expected SARSA अपडेट नियम इम्प्लीमेंट करेंगे, जो एक temporal difference मॉडल-फ्री RL एल्गोरिदम है. Expected SARSA, सभी संभावित actions पर औसत लेकर वर्तमान पॉलिसी के expected value का अनुमान लगाता है, जिससे SARSA की तुलना में अधिक स्थिर अपडेट टार्गेट मिलता है. Expected SARSA में उपयोग होने वाले फॉर्मूले नीचे दिए गए हैं.

numpy लाइब्रेरी को np नाम से इम्पोर्ट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
next_stateके लिए expected Q-value निकालें.- Expected SARSA फॉर्मूला का उपयोग करके वर्तमान
stateऔरactionका Q-value अपडेट करें. - Q-table
Qको अपडेट करें, मान लीजिए एजेंट state2में action1लेता है और state3पर चला जाता है, और उसे5का रिवॉर्ड मिलता है.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
def update_q_table(state, action, next_state, reward):
# Calculate the expected Q-value for the next state
expected_q = ____
# Update the Q-value for the current state and action
Q[state, action] = ____
Q = np.random.rand(5, 2)
print("Old Q:\n", Q)
alpha = 0.1
gamma = 0.99
# Update the Q-table
update_q_table(____, ____, ____, ____)
print("Updated Q:\n", Q)