सबसे बेहतर फ्लाइट ड्यूरेशन मॉडल की पड़ताल
आपने अभी-अभी फ्लाइट ड्यूरेशन की भविष्यवाणी करने वाले लीनियर रिग्रेशन मॉडल के लिए अच्छे पैरामीटर्स ढूँढने हेतु CrossValidator सेट अप किया है.
मॉडल पाइपलाइन में कई स्टेज होते हैं (StringIndexer, OneHotEncoder, VectorAssembler और LinearRegression टाइप के ऑब्जेक्ट), जो क्रम में काम करते हैं. पाइपलाइन ऑब्जेक्ट पर stages एट्रिब्यूट के रूप में ये स्टेज उपलब्ध होते हैं. ये एक लिस्ट में दर्शाए जाते हैं और उसी क्रम में निष्पादित होते हैं जिसमें वे लिस्ट में दिखाई देते हैं.
अब आप पाइपलाइन को और नज़दीक से देखेंगे, स्टेज को अलग करेंगे और टेस्टिंग डेटा पर प्रेडिक्शन बनाने के लिए इसका उपयोग करेंगे.
निम्न ऑब्जेक्ट पहले से बनाए जा चुके हैं:
cv— एक प्रशिक्षितCrossValidatorModelऑब्जेक्ट औरevaluator— एकRegressionEvaluatorऑब्जेक्ट.
फ्लाइट्स डेटा को रैंडम तरीके से flights_train और flights_test में विभाजित किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
- बेस्ट मॉडल प्राप्त करें.
- बेस्ट मॉडल के स्टेज देखें.
- लीनियर रिग्रेशन स्टेज को अलग करें और उसके पैरामीटर्स निकालें.
- बेस्ट मॉडल से टेस्टिंग डेटा पर प्रेडिक्शन जनरेट करें और RMSE की गणना करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Get the best model from cross validation
best_model = cv.____
# Look at the stages in the best model
print(best_model.____)
# Get the parameters for the LinearRegression object in the best model
best_model.____.extractParamMap()
# Generate predictions on testing data using the best model then calculate RMSE
predictions = ____.____(____)
print("RMSE =", ____.____(____))