एक वेक्टर असेंबल करें
Pipeline का आखिरी चरण यह है कि हमारी सभी फीचर वाली कॉलम्स को एक ही कॉलम में जोड़ दिया जाए. मॉडलिंग शुरू करने से पहले यह करना ज़रूरी है, क्योंकि हर Spark मॉडलिंग रूटीन डेटा को इसी फ़ॉर्म में अपेक्षित करता है. आप यह इस तरह कर सकते हैं कि किसी कॉलम के प्रत्येक मान को एक वेक्टर की एंट्री के रूप में संग्रहीत करें. फिर, मॉडल के नज़रिए से, हर ऑब्ज़र्वेशन एक ऐसा वेक्टर होता है जिसमें उसके बारे में सारी जानकारी होती है और एक लेबल होता है जो बताता है कि वह ऑब्ज़र्वेशन किस मान से संबंधित है.
इसी कारण pyspark.ml.feature सबमॉड्यूल में VectorAssembler नाम की एक क्लास होती है. यह Transformer आपके द्वारा बताई गई सभी कॉलम्स को लेकर उन्हें एक नए वेक्टर कॉलम में जोड़ देता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark की नींव
अभ्यास निर्देश
VectorAssembler()कॉल करके,inputColsनामों की लिस्ट औरoutputColनाम"features"के साथ एकVectorAssemblerबनाएँ.- कॉलम्स की लिस्ट यह होनी चाहिए:
["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].
- कॉलम्स की लिस्ट यह होनी चाहिए:
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)