शुरू करेंमुफ़्त में शुरू करें

कॉलम्स को असेंबल करना

डेटा तैयारी का अंतिम चरण है सभी प्रेडिक्टर कॉलम्स को एक ही कॉलम में समेकित करना.

flights डेटा का एक अपडेटेड संस्करण, जिसमें पिछले कुछ अभ्यासों के सभी बदलाव शामिल हैं, में निम्न प्रेडिक्टर कॉलम्स हैं:

  • mon, dom और dow
  • carrier_idx (carrier से इंडेक्स किया हुआ मान)
  • org_idx (org से इंडेक्स किया हुआ मान)
  • km
  • depart
  • duration

नोट: show() मेथड में truncate=False आर्ग्यूमेंट आउटपुट में डेटा को ट्रंकेट होने से रोकता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • उस क्लास को इम्पोर्ट करें जो प्रेडिक्टर्स को असेंबल करेगी.
  • ऐसा असेंबलर ऑब्जेक्ट बनाएँ जो प्रेडिक्टर कॉलम्स को एक सिंगल कॉलम में मर्ज करने देगा.
  • नए समेकित कॉलम को जनरेट करने के लिए असेंबलर का उपयोग करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
कोड संपादित करें और चलाएँ