Sammanfoga kolumner
Det sista steget i dataförberedelsen är att slå ihop alla prediktorkolumner till en enda kolumn.
En uppdaterad version av flights-data, som tar hänsyn till alla ändringar från de tidigare övningarna, har följande prediktorkolumner:
mon,domochdowcarrier_idx(indexerat värde fråncarrier)org_idx(indexerat värde frånorg)kmdepartduration
Obs: Argumentet truncate=False till metoden show() förhindrar att data trunkeras i utdata.
Den här övningen är en del av kursen
Maskininlärning med PySpark
Övningsinstruktioner
- Importera klassen som sammanfogar prediktorerna.
- Skapa ett assembler-objekt som låter dig slå ihop prediktorkolumnerna till en enda kolumn.
- Använd assembler-objektet för att generera en ny sammanslagen kolumn.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)