किसी नीति के लिए state-values की गणना
इसी निर्धारक परिवेश MyGridWorld का उपयोग करते हुए, अब आपको पिछली कसरत में परिभाषित की गई नीति की प्रभावशीलता का आकलन करना है. आप ऐसा इस नीति के अंतर्गत प्रत्येक state के लिए state value फंक्शन की गणना करके करेंगे.
परिवेश env के रूप में इम्पोर्ट किया गया है, साथ ही आवश्यक वैरिएबल्स भी उपलब्ध हैं (terminal_state, num_states, policy, gamma).
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- दिए गए policy के अंतर्गत प्रत्येक state का value निकालने के लिए
compute_state_value()फंक्शन को पूरा करें. - एक
state_valuesdictionary बनाएँ जहाँ हर key एकstateहो और उसकी value उस state का state value हो.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Complete the function
def compute_state_value(state):
if state == terminal_state:
return ____
action = ____
_, next_state, reward, _ = env.unwrapped.P[state][action][0]
return ____
# Compute all state values
state_values = {____: ____ for ____ in range(____)}
print(state_values)