शुरू करेंमुफ़्त में शुरू करें

फ्लाइट ड्यूरेशन मॉडल पाइपलाइन का क्रॉस-वैलिडेशन

जो क्रॉस-वैलिडेटेड मॉडल आपने अभी बनाया, वह सरल था और केवल km के आधार पर duration की भविष्यवाणी करता था.

फ्लाइट ड्यूरेशन का एक और अहम प्रेडिक्टर origin एयरपोर्ट है. व्यस्त एयरपोर्ट्स से उड़ान भरने में आम तौर पर ज्यादा समय लगता है. आइए देखें, क्या इस प्रेडिक्टर को जोड़ने से मॉडल बेहतर होता है!

इस अभ्यास में आप मॉडल में org फ़ील्ड जोड़ेंगे. लेकिन क्योंकि org कैटेगोरिकल है, इसे शामिल करने से पहले कुछ अतिरिक्त काम करना होगा: पहले इसे इंडेक्स में बदलना होगा, फिर वन-हॉट एन्कोड करना होगा, उसके बाद km के साथ असेंबल कर के रिग्रेशन मॉडल बनाने में उपयोग करना होगा. हम इन सभी ऑपरेशंस को एक पाइपलाइन में रैप करेंगे.

निम्न ऑब्जेक्ट पहले से बनाए जा चुके हैं:

  • params — एक खाली पैरामीटर ग्रिड
  • evaluator — एक रिग्रेशन इवैल्यूएटर
  • regressionlabelCol='duration' के साथ एक LinearRegression ऑब्जेक्ट.

StringIndexer, OneHotEncoder, VectorAssembler और CrossValidator क्लास पहले से इम्पोर्ट किए गए हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • एक स्ट्रिंग इंडेक्सर बनाएँ. इनपुट और आउटपुट फ़ील्ड क्रमशः org और org_idx दें.
  • एक वन-हॉट एन्कोडर बनाएँ. आउटपुट फ़ील्ड का नाम org_dummy रखें.
  • km और org_dummy फ़ील्ड्स को असेंबल करके features नाम का एक सिंगल फ़ील्ड बनाएँ.
  • निम्न ऑपरेशंस के साथ एक पाइपलाइन बनाएँ: स्ट्रिंग इंडेक्सर, वन-हॉट एन्कोडर, असेंबलर और लीनियर रिग्रेशन. इसका उपयोग करके एक क्रॉस-वैलिडेटर बनाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create an indexer for the org field
indexer = ____(____, ____)

# Create an one-hot encoder for the indexed org field
onehot = ____(____, ____)

# Assemble the km and one-hot encoded fields
assembler = ____(____, ____)

# Create a pipeline and cross-validator.
pipeline = ____(stages=[____, ____, ____, ____])
cv = ____(estimator=____,
          estimatorParamMaps=____,
          evaluator=____)
कोड संपादित करें और चलाएँ