Asamblarea coloanelor
Ultima etapă a pregătirii datelor constă în consolidarea tuturor coloanelor de predictori într-o singură coloană.
O versiune actualizată a datelor flights, care ține cont de toate modificările din exercițiile anterioare, conține următoarele coloane de predictori:
mon,domșidowcarrier_idx(valoare indexată dincarrier)org_idx(valoare indexată dinorg)kmdepartduration
Notă: Argumentul truncate=False transmis metodei show() previne truncherea datelor în rezultate.
Acest exercițiu face parte din cursul
Machine Learning cu PySpark
Instrucțiuni pentru exercițiu
- Importă clasa care va asambla predictorii.
- Creează un obiect assembler care să îți permită să combini coloanele de predictori într-o singură coloană.
- Folosește assembler-ul pentru a genera noua coloană consolidată.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)