शुरू करेंमुफ़्त में शुरू करें

ट्रांज़िशन प्रायिकताएँ और रिवॉर्ड्स

Cliff Walking एनवायरनमेंट में 48 स्टेट्स हैं, जिन्हें 0 से 47 तक नंबर दिया गया है, लाइन-दर-लाइन — ऊपर-बाएँ कोने (0) से नीचे-दाएँ कोने (47) तक. आपका उद्देश्य इस सेटअप में ट्रांज़िशन प्रायिकताएँ और रिवॉर्ड्स की संरचना को समझना है. ध्यान दें कि इस एनवायरनमेंट में सभी रिवॉर्ड्स, लक्ष्य तक पहुँचने का रिवॉर्ड भी, नेगेटिव हैं. यह डिज़ाइन इस बात पर ज़ोर देता है कि स्टेप्स की संख्या कम से कम रखी जाए, क्योंकि हर स्टेप पर पेनल्टी लगती है. इसलिए, प्रभावी लर्निंग एल्गोरिदम डिज़ाइन करने के लिए दक्षता एक प्रमुख पहलू बन जाता है.

gymnasium लाइब्रेरी gym नाम से और एनवायरनमेंट env नाम से इम्पोर्ट किए गए हैं. साथ ही पिछले अभ्यास से num_states और num_actions भी इम्पोर्ट किए गए हैं.

Image showing the cliff walking environment.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Choose the state
state = ____

# Extract transitions for each state-action pair
for action in range(num_actions):
    transitions = ____
    # Print details of each transition
    for transition in transitions:
        ____, ____, ____, ____ = transition
        print(f"Probability: {probability}, Next State: {next_state}, Reward: {reward}, Done: {done}")
कोड संपादित करें और चलाएँ