Q-values की गणना
आपका लक्ष्य नीचे दी गई policy का पालन करते हुए कस्टम MyGridWorld environment में प्रत्येक state-action जोड़े के लिए action-values (यानी Q-values) की गणना करना है। RL में Q-values इसलिए महत्वपूर्ण हैं क्योंकि वे किसी दिए गए state में कोई विशेष action चलाने के अपेक्षित utility को दर्शाते हैं, और उसके बाद policy का पालन मानते हैं.

Environment को env के रूप में, साथ ही compute_state_value() फंक्शन और आवश्यक वैरिएबल्स (terminal_state, num_states, num_actions, policy, gamma) आयात किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Gymnasium के साथ Reinforcement Learning
अभ्यास निर्देश
- दिए गए
stateऔरactionके लिए action-value निकालने के लिएcompute_q_value()फंक्शन को पूरा करें. - एक डिक्शनरी
Qबनाएँ जहाँ हर key एक state-action जोड़े का प्रतिनिधित्व करे, और उसकी value उस जोड़े का Q-value हो.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Complete the function to compute the action-value for a state-action pair
def compute_q_value(state, action):
if state == terminal_state:
return None
probability, next_state, reward, done = ____
return ____
# Compute Q-values for each state-action pair
Q = {(____, ____): _____ for ____ in range(____) for ____ in range(____)}
print(Q)