Ensamblar columnas
La última fase de la preparación de datos es consolidar todas las columnas predictoras en una sola columna.
Una versión actualizada de los datos de flights, que incorpora todos los cambios de los ejercicios anteriores, tiene las siguientes columnas predictoras:
mon,domydowcarrier_idx(valor indexado decarrier)org_idx(valor indexado deorg)kmdepartduration
Nota: El argumento truncate=False del método show() evita que los datos se recorten en la salida.
Este ejercicio forma parte del curso
Machine learning con PySpark
Instrucciones del ejercicio
- Importa la clase que ensamblará los predictores.
- Crea un objeto assembler que te permita combinar las columnas predictoras en una sola columna.
- Usa el assembler para generar una nueva columna consolidada.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)