शुरू करेंमुफ़्त में शुरू करें

Policies की तुलना

आपको MyGridWorld एनवायरनमेंट में दो अलग-अलग policies के अनुरूप दो state value functions (value_function_1 और value_function_2) दिए गए हैं। आपका काम है इन state value functions को state-दर-state तुलना करना, ताकि यह तय किया जा सके कि कौन‑सी policy ज़्यादा प्रभावी है।

वैरिएबल num_states आपके उपयोग के लिए उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • boolean मानों की एक लिस्ट one_is_better बनाएँ, जहाँ हर एलिमेंट जाँचता है कि value_function_1 में उस state का मान value_function_2 के उस state के मान से अधिक या बराबर है या नहीं.
  • boolean मानों की एक लिस्ट two_is_better बनाएँ, जहाँ हर एलिमेंट जाँचता है कि value_function_2 में उस state का मान value_function_1 के उस state के मान से अधिक या बराबर है या नहीं.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

value_function_1 = {0: 1, 1: 2, 2: 3, 3: 7, 4: 6, 5: 4, 6: 8, 7: 10, 8: 0}
value_function_2 = {0: 7, 1: 8, 2: 9, 3: 7, 4: 9, 5: 10, 6: 8, 7: 10, 8: 0}

# Check for each value in policy 1 if it is better than policy 2
one_is_better = [____ >= ____ for state in range(num_states)]

# Check for each value in policy 2 if it is better than policy 1
two_is_better = [____ >= ____ for state in range(num_states)]

if all(one_is_better):
  print("Policy 1 is better.")
elif all(two_is_better):
  print("Policy 2 is better.")
else:
  print("Neither policy is uniformly better across all states.")
कोड संपादित करें और चलाएँ