Sätt ihop en vektor
Det sista steget i Pipeline är att kombinera alla kolumner med våra särdrag till en enda kolumn. Det här måste göras innan modelleringen kan börja, eftersom alla modelleringsrutiner i Spark förväntar sig att data har den här formen. Du gör det genom att lagra varje värde från en kolumn som ett element i en vektor. Från modellens perspektiv är varje observation en vektor som innehåller all information om den, tillsammans med en etikett som anger vilket värde observationen motsvarar.
Därför innehåller submodulen pyspark.ml.feature en klass som heter VectorAssembler. Den här Transformer tar alla kolumner du anger och kombinerar dem till en ny vektorkolumn.
Den här övningen är en del av kursen
Grunderna i PySpark
Övningsinstruktioner
- Skapa en
VectorAssemblergenom att anropaVectorAssembler()med kolumnnamnen iinputColssom en lista ochoutputCol-namnet"features".- Listan med kolumner ska vara
["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].
- Listan med kolumner ska vara
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)