Double Q-learning का अपडेट रूल लागू करना
Double Q-learning, Q-learning एल्गोरिदम का एक एक्सटेंशन है जो action values के overestimation को कम करने में मदद करता है. यह दो अलग-अलग Q-tables को बनाए रखकर और अपडेट करके ऐसा करता है. Action selection को action evaluation से अलग करके, Double Q-learning Q-values का ज़्यादा सटीक अनुमान देता है. इस अभ्यास में आप Double Q-learning के update rule को लागू करेंगे. एक लिस्ट Q बनाई गई है जिसमें दो Q-tables हैं.
numpy लाइब्रेरी को np नाम से इम्पोर्ट किया गया है, और gamma तथा alpha के मान पहले से लोड हैं. अपडेट फ़ॉर्मूले नीचे दिए गए हैं:


यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- Action value estimation के लिए
Qके अंदर किस Q-table को अपडेट करना है, यह यादृच्छिक रूप से तय करें और उसका इंडेक्सiनिकालें. Q[i]को अपडेट करने के लिए आवश्यक स्टेप्स लागू करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
Q = [np.random.rand(8,4), np.random.rand(8,4)]
def update_q_tables(state, action, reward, next_state):
# Get the index of the table to update
i = ____
# Update Q[i]
best_next_action = ____
Q[i][state, action] = ____