फ्लाइट ड्यूरेशन मॉडल पाइपलाइन का क्रॉस-वैलिडेशन
जो क्रॉस-वैलिडेटेड मॉडल आपने अभी बनाया, वह सरल था और केवल km के आधार पर duration की भविष्यवाणी करता था.
फ्लाइट ड्यूरेशन का एक और अहम प्रेडिक्टर origin एयरपोर्ट है. व्यस्त एयरपोर्ट्स से उड़ान भरने में आम तौर पर ज्यादा समय लगता है. आइए देखें, क्या इस प्रेडिक्टर को जोड़ने से मॉडल बेहतर होता है!
इस अभ्यास में आप मॉडल में org फ़ील्ड जोड़ेंगे. लेकिन क्योंकि org कैटेगोरिकल है, इसे शामिल करने से पहले कुछ अतिरिक्त काम करना होगा: पहले इसे इंडेक्स में बदलना होगा, फिर वन-हॉट एन्कोड करना होगा, उसके बाद km के साथ असेंबल कर के रिग्रेशन मॉडल बनाने में उपयोग करना होगा. हम इन सभी ऑपरेशंस को एक पाइपलाइन में रैप करेंगे.
निम्न ऑब्जेक्ट पहले से बनाए जा चुके हैं:
params— एक खाली पैरामीटर ग्रिडevaluator— एक रिग्रेशन इवैल्यूएटरregression—labelCol='duration'के साथ एकLinearRegressionऑब्जेक्ट.
StringIndexer, OneHotEncoder, VectorAssembler और CrossValidator क्लास पहले से इम्पोर्ट किए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
- एक स्ट्रिंग इंडेक्सर बनाएँ. इनपुट और आउटपुट फ़ील्ड क्रमशः
orgऔरorg_idxदें. - एक वन-हॉट एन्कोडर बनाएँ. आउटपुट फ़ील्ड का नाम
org_dummyरखें. kmऔरorg_dummyफ़ील्ड्स को असेंबल करकेfeaturesनाम का एक सिंगल फ़ील्ड बनाएँ.- निम्न ऑपरेशंस के साथ एक पाइपलाइन बनाएँ: स्ट्रिंग इंडेक्सर, वन-हॉट एन्कोडर, असेंबलर और लीनियर रिग्रेशन. इसका उपयोग करके एक क्रॉस-वैलिडेटर बनाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create an indexer for the org field
indexer = ____(____, ____)
# Create an one-hot encoder for the indexed org field
onehot = ____(____, ____)
# Assemble the km and one-hot encoded fields
assembler = ____(____, ____)
# Create a pipeline and cross-validator.
pipeline = ____(stages=[____, ____, ____, ____])
cv = ____(estimator=____,
estimatorParamMaps=____,
evaluator=____)