Unindo colunas
A etapa final da preparação dos dados é consolidar todas as colunas preditoras em uma única coluna.
Uma versão atualizada dos dados flights, que leva em conta todas as mudanças dos últimos exercícios, tem as seguintes colunas preditoras:
mon,domedowcarrier_idx(valor indexado decarrier)org_idx(valor indexado deorg)kmdepartduration
Observação: O argumento truncate=False do método show() evita que os dados sejam truncados na saída.
Este exercicio faz parte do curso
Machine learning com PySpark
Instruções do exercicio
- Importe a classe que vai montar as variáveis preditoras.
- Crie um objeto assembler que permita unir as colunas preditoras em uma única coluna.
- Use o assembler para gerar uma nova coluna consolidada.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)