Machine Learning Pipelines
अगले दो अध्यायों में आप मशीन लर्निंग पाइपलाइन के हर चरण से होकर गुजरेंगे — डेटा इंटेक से लेकर मॉडल इवैल्यूएशन तक. चलिए शुरू करते हैं!
pyspark.ml मॉड्यूल के केंद्र में Transformer और Estimator कक्षाएँ हैं. मॉड्यूल की लगभग हर दूसरी कक्षा का बर्ताव इन्हीं दो बुनियादी कक्षाओं जैसा होता है.
Transformer कक्षाओं में .transform() मेथड होता है जो एक DataFrame लेता है और एक नया DataFrame लौटाता है; आम तौर पर मूल DataFrame में एक नया कॉलम जोड़कर. उदाहरण के लिए, आप Bucketizer कक्षा का उपयोग किसी continuous फीचर से discrete बिन बनाने के लिए कर सकते हैं या PCA कक्षा का उपयोग principal component analysis से अपने डेटासेट की dimensionality घटाने के लिए कर सकते हैं.
Estimator कक्षाएँ .fit() मेथड लागू करती हैं. ये मेथड भी एक DataFrame लेती हैं, लेकिन दूसरा DataFrame लौटाने के बजाय एक मॉडल ऑब्जेक्ट लौटाती हैं. यह StringIndexerModel जैसा कुछ हो सकता है, जिससे आप strings के रूप में सहेजे गए categorical डेटा को अपने मॉडलों में शामिल करते हैं, या RandomForestModel जो classification या regression के लिए random forest एल्गोरिदम का उपयोग करता है.
निम्न में से कौन-सा कथन Spark में मशीन लर्निंग के बारे में सत्य नहीं है?
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark की नींव
इंटरैक्टिव व्यावहारिक अभ्यास
हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें
अभ्यास शुरू करें