शुरू करेंमुफ़्त में शुरू करें

Q-values की गणना

आपका लक्ष्य नीचे दी गई policy का पालन करते हुए कस्टम MyGridWorld environment में प्रत्येक state-action जोड़े के लिए action-values (यानी Q-values) की गणना करना है। RL में Q-values इसलिए महत्वपूर्ण हैं क्योंकि वे किसी दिए गए state में कोई विशेष action चलाने के अपेक्षित utility को दर्शाते हैं, और उसके बाद policy का पालन मानते हैं.

exercise_policy.png

Environment को env के रूप में, साथ ही compute_state_value() फंक्शन और आवश्यक वैरिएबल्स (terminal_state, num_states, num_actions, policy, gamma) आयात किया गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • दिए गए state और action के लिए action-value निकालने के लिए compute_q_value() फंक्शन को पूरा करें.
  • एक डिक्शनरी Q बनाएँ जहाँ हर key एक state-action जोड़े का प्रतिनिधित्व करे, और उसकी value उस जोड़े का Q-value हो.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
    if state == terminal_state:
        return None   
    probability, next_state, reward, done = ____
    return ____

# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}

print(Q)
कोड संपादित करें और चलाएँ