शुरू करेंमुफ़्त में शुरू करें

Double Q-learning का अपडेट रूल लागू करना

Double Q-learning, Q-learning एल्गोरिदम का एक एक्सटेंशन है जो action values के overestimation को कम करने में मदद करता है. यह दो अलग-अलग Q-tables को बनाए रखकर और अपडेट करके ऐसा करता है. Action selection को action evaluation से अलग करके, Double Q-learning Q-values का ज़्यादा सटीक अनुमान देता है. इस अभ्यास में आप Double Q-learning के update rule को लागू करेंगे. एक लिस्ट Q बनाई गई है जिसमें दो Q-tables हैं.

numpy लाइब्रेरी को np नाम से इम्पोर्ट किया गया है, और gamma तथा alpha के मान पहले से लोड हैं. अपडेट फ़ॉर्मूले नीचे दिए गए हैं:

Image showing the update rule of Q1.

Image showing the update rule of Q2.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Action value estimation के लिए Q के अंदर किस Q-table को अपडेट करना है, यह यादृच्छिक रूप से तय करें और उसका इंडेक्स i निकालें.
  • Q[i] को अपडेट करने के लिए आवश्यक स्टेप्स लागू करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

Q = [np.random.rand(8,4), np.random.rand(8,4)] 
def update_q_tables(state, action, reward, next_state):
  	# Get the index of the table to update
    i = ____
    # Update Q[i]
    best_next_action = ____
    Q[i][state, action] = ____
कोड संपादित करें और चलाएँ