शुरू करेंमुफ़्त में शुरू करें

RL इंटरैक्शन लूप

जैसा कि अब तक आप जान चुके हैं, RL में एक एजेंट पर्यावरण में फैसले लेता है ताकि संचयी रिवॉर्ड को अधिकतम किया जा सके. एजेंट को इंटरैक्शन के ज़रिए यह खोजना होता है कि किन एक्शंस से सबसे अधिक रिवॉर्ड मिलता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Gymnasium के साथ Reinforcement Learning

पाठ्यक्रम देखें

इंटरैक्टिव व्यावहारिक अभ्यास

हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें

अभ्यास शुरू करें