EmpezarEmpieza gratis

Ensamblar columnas

La última fase de la preparación de datos es consolidar todas las columnas predictoras en una sola columna.

Una versión actualizada de los datos de flights, que incorpora todos los cambios de los ejercicios anteriores, tiene las siguientes columnas predictoras:

  • mon, dom y dow
  • carrier_idx (valor indexado de carrier)
  • org_idx (valor indexado de org)
  • km
  • depart
  • duration

Nota: El argumento truncate=False del método show() evita que los datos se recorten en la salida.

Este ejercicio forma parte del curso

Machine learning con PySpark

Ver curso

Instrucciones del ejercicio

  • Importa la clase que ensamblará los predictores.
  • Crea un objeto assembler que te permita combinar las columnas predictoras en una sola columna.
  • Usa el assembler para generar una nueva columna consolidada.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
Editar y ejecutar código