or
यह अभ्यास पाठ्यक्रम का हिस्सा है
Spark बड़े डेटा के साथ काम करने के लिए एक फ्रेमवर्क है। इस अध्याय में आप Spark और Machine Learning की पृष्ठभूमि कवर करेंगे। फिर आप Python के ज़रिए Spark से कनेक्ट करना और CSV डेटा लोड करना सीखेंगे।
अब जब आप Spark में डेटा लाने से परिचित हैं, तो आप दो तरह के क्लासिफिकेशन मॉडल बनाएँगे: Decision Trees और Logistic Regression। आप डेटा प्रिपरेशन के कुछ तरीकों के बारे में भी जानेंगे।
अगले चरण में आप Linear Regression मॉडल बनाना सीखेंगे। आप नए प्रीडिक्टर्स इंजीनियर करके डेटा को बेहतर बनाना और केवल सबसे प्रासंगिक प्रीडिक्टर्स चुनने के एक मज़बूत तरीके के बारे में भी जानेंगे।
वर्तमान अभ्यास
अंत में आप सीखेंगे कि अपने मॉडल्स को और कुशल कैसे बनाया जाए। आप पाइपलाइंस का उपयोग करना सीखेंगे ताकि आपका कोड साफ़ और मेंटेन करना आसान हो। फिर आप क्रॉस-वैलिडेशन का उपयोग करेंगे ताकि मॉडल्स का बेहतर परीक्षण हो और अच्छे पैरामीटर्स चुने जा सकें। अंत में, आप दो प्रकार के एंसेंबल मॉडल्स आज़माएँगे।