कॉलम्स को असेंबल करना
डेटा तैयारी का अंतिम चरण है सभी प्रेडिक्टर कॉलम्स को एक ही कॉलम में समेकित करना.
flights डेटा का एक अपडेटेड संस्करण, जिसमें पिछले कुछ अभ्यासों के सभी बदलाव शामिल हैं, में निम्न प्रेडिक्टर कॉलम्स हैं:
mon,domऔरdowcarrier_idx(carrierसे इंडेक्स किया हुआ मान)org_idx(orgसे इंडेक्स किया हुआ मान)kmdepartduration
नोट: show() मेथड में truncate=False आर्ग्यूमेंट आउटपुट में डेटा को ट्रंकेट होने से रोकता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
- उस क्लास को इम्पोर्ट करें जो प्रेडिक्टर्स को असेंबल करेगी.
- ऐसा असेंबलर ऑब्जेक्ट बनाएँ जो प्रेडिक्टर कॉलम्स को एक सिंगल कॉलम में मर्ज करने देगा.
- नए समेकित कॉलम को जनरेट करने के लिए असेंबलर का उपयोग करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)