शुरू करेंमुफ़्त में शुरू करें

किसी नीति के लिए state-values की गणना

इसी निर्धारक परिवेश MyGridWorld का उपयोग करते हुए, अब आपको पिछली कसरत में परिभाषित की गई नीति की प्रभावशीलता का आकलन करना है. आप ऐसा इस नीति के अंतर्गत प्रत्येक state के लिए state value फंक्शन की गणना करके करेंगे.

परिवेश env के रूप में इम्पोर्ट किया गया है, साथ ही आवश्यक वैरिएबल्स भी उपलब्ध हैं (terminal_state, num_states, policy, gamma).

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • दिए गए policy के अंतर्गत प्रत्येक state का value निकालने के लिए compute_state_value() फंक्शन को पूरा करें.
  • एक state_values dictionary बनाएँ जहाँ हर key एक state हो और उसकी value उस state का state value हो.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Complete the function
def compute_state_value(state):
    if state == terminal_state:
        return ____
    action = ____
    _, next_state, reward, _ = env.unwrapped.P[state][action][0]
    return ____

# Compute all state values 
state_values = {____: ____ for ____ in range(____)}

print(state_values)
कोड संपादित करें और चलाएँ