ÎncepețiÎncepe gratuit

Asamblarea coloanelor

Ultima etapă a pregătirii datelor constă în consolidarea tuturor coloanelor de predictori într-o singură coloană.

O versiune actualizată a datelor flights, care ține cont de toate modificările din exercițiile anterioare, conține următoarele coloane de predictori:

  • mon, dom și dow
  • carrier_idx (valoare indexată din carrier)
  • org_idx (valoare indexată din org)
  • km
  • depart
  • duration

Notă: Argumentul truncate=False transmis metodei show() previne truncherea datelor în rezultate.

Acest exercițiu face parte din cursul

Machine Learning cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă clasa care va asambla predictorii.
  • Creează un obiect assembler care să îți permită să combini coloanele de predictori într-o singură coloană.
  • Folosește assembler-ul pentru a genera noua coloană consolidată.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
Editează și rulează codul