शुरू करेंमुफ़्त में शुरू करें

एक वेक्टर असेंबल करें

Pipeline का आखिरी चरण यह है कि हमारी सभी फीचर वाली कॉलम्स को एक ही कॉलम में जोड़ दिया जाए. मॉडलिंग शुरू करने से पहले यह करना ज़रूरी है, क्योंकि हर Spark मॉडलिंग रूटीन डेटा को इसी फ़ॉर्म में अपेक्षित करता है. आप यह इस तरह कर सकते हैं कि किसी कॉलम के प्रत्येक मान को एक वेक्टर की एंट्री के रूप में संग्रहीत करें. फिर, मॉडल के नज़रिए से, हर ऑब्ज़र्वेशन एक ऐसा वेक्टर होता है जिसमें उसके बारे में सारी जानकारी होती है और एक लेबल होता है जो बताता है कि वह ऑब्ज़र्वेशन किस मान से संबंधित है.

इसी कारण pyspark.ml.feature सबमॉड्यूल में VectorAssembler नाम की एक क्लास होती है. यह Transformer आपके द्वारा बताई गई सभी कॉलम्स को लेकर उन्हें एक नए वेक्टर कॉलम में जोड़ देता है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

अभ्यास निर्देश

  • VectorAssembler() कॉल करके, inputCols नामों की लिस्ट और outputCol नाम "features" के साथ एक VectorAssembler बनाएँ.
    • कॉलम्स की लिस्ट यह होनी चाहिए: ["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)
कोड संपादित करें और चलाएँ