फ़्लाइट अवधि मॉडल: और फीचर्स!
आइए अपने मॉडल में और फीचर्स जोड़ते हैं. यह ज़रूरी नहीं कि इससे मॉडल बेहतर ही हो जाए. कुछ फीचर्स जोड़ने से मॉडल सुधर सकता है. दूसरे फीचर्स जोड़ने से यह खराब भी हो सकता है.
ज़्यादा फीचर्स मॉडल को हमेशा अधिक जटिल और समझने में कठिन बनाते हैं.
अगले मॉडल में आप ये फीचर्स शामिल करेंगे:
kmorg(origin एयरपोर्ट, one-hot encoded, 8 लेवल)depart(departure time, 3 घंटे के इंटरवल में बिन किया हुआ, one-hot encoded, 8 लेवल)dow(सप्ताह का प्रस्थान दिन, one-hot encoded, 7 लेवल) औरmon(प्रस्थान महीना, one-hot encoded, 12 लेवल).
इन्हें features कॉलम में असेंबल किया गया है, जो 32 कॉलम का sparse प्रतिनिधित्व है (याद रखें, one-hot encoding उतने कॉलम बनाती है जो लेवल की संख्या से एक कम होते हैं).
डेटा flights के रूप में उपलब्ध है, जिसे रैंडम तरीके से flights_train और flights_test में बाँटा गया है.
यह अभ्यास flights डेटा के एक छोटे सबसेट पर आधारित है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
- ट्रेनिंग डेटा पर एक linear regression मॉडल फिट करें.
- टेस्टिंग डेटा के लिए प्रेडिक्शंस जनरेट करें.
- टेस्टिंग डेटा पर RMSE कैलकुलेट करें.
- मॉडल के coefficients देखें. क्या इनमें से कोई शून्य है?
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from pyspark.ml.regression import ____
from pyspark.ml.evaluation import ____
# Fit linear regression model to training data
regression = ____(____).____(____)
# Make predictions on testing data
predictions = regression.____(____)
# Calculate the RMSE on testing data
rmse = ____(____).____(____)
print("The test RMSE is", rmse)
# Look at the model coefficients
coeffs = regression.____
print(coeffs)