Kolommen samenvoegen
De laatste stap van de datapreparatie is om alle predictorkolommen samen te voegen in één kolom.
Een bijgewerkte versie van de flights-gegevens, waarin alle wijzigingen uit de vorige paar oefeningen zijn meegenomen, heeft de volgende predictorkolommen:
mon,domendowcarrier_idx(geïndexeerde waarde vancarrier)org_idx(geïndexeerde waarde vanorg)kmdepartduration
Let op: Het argument truncate=False bij de methode show() voorkomt dat gegevens in de output worden afgekapt.
Deze oefening maakt deel uit van de cursus
Machine Learning met PySpark
Oefeninstructies
- Importeer de klasse die de predictors zal samenstellen.
- Maak een assembler-object waarmee je de predictorkolommen kunt samenvoegen tot één kolom.
- Gebruik de assembler om een nieuwe, samengevoegde kolom te genereren.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)