Sestavení sloupců
Poslední fází přípravy dat je sloučení všech predikčních sloupců do jednoho.
Aktualizovaná verze dat flights, která zohledňuje všechny změny z předchozích cvičení, obsahuje tyto predikční sloupce:
mon,domadowcarrier_idx(indexovaná hodnota zcarrier)org_idx(indexovaná hodnota zorg)kmdepartduration
Poznámka: Argument truncate=False metody show() zabrání zkracování dat ve výstupu.
Toto cvičení je součástí kurzu
Machine Learning with PySpark
Pokyny k cvičení
- Importuj třídu, která slouží ke sestavení prediktorů.
- Vytvoř objekt assembleru, který ti umožní sloučit predikční sloupce do jednoho sloupce.
- Použij assembler k vytvoření nového sloučeného sloupce.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)