Začněte nyníZačněte zdarma

Sestavení sloupců

Poslední fází přípravy dat je sloučení všech predikčních sloupců do jednoho.

Aktualizovaná verze dat flights, která zohledňuje všechny změny z předchozích cvičení, obsahuje tyto predikční sloupce:

  • mon, dom a dow
  • carrier_idx (indexovaná hodnota z carrier)
  • org_idx (indexovaná hodnota z org)
  • km
  • depart
  • duration

Poznámka: Argument truncate=False metody show() zabrání zkracování dat ve výstupu.

Toto cvičení je součástí kurzu

Machine Learning with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Importuj třídu, která slouží ke sestavení prediktorů.
  • Vytvoř objekt assembleru, který ti umožní sloučit predikční sloupce do jednoho sloupce.
  • Použij assembler k vytvoření nového sloučeného sloupce.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
Upravit a spustit kód