Comece agoraComece grátis

Unindo colunas

A etapa final da preparação dos dados é consolidar todas as colunas preditoras em uma única coluna.

Uma versão atualizada dos dados flights, que leva em conta todas as mudanças dos últimos exercícios, tem as seguintes colunas preditoras:

  • mon, dom e dow
  • carrier_idx (valor indexado de carrier)
  • org_idx (valor indexado de org)
  • km
  • depart
  • duration

Observação: O argumento truncate=False do método show() evita que os dados sejam truncados na saída.

Este exercicio faz parte do curso

Machine learning com PySpark

Ver curso

Instruções do exercicio

  • Importe a classe que vai montar as variáveis preditoras.
  • Crie um objeto assembler que permita unir as colunas preditoras em uma única coluna.
  • Use o assembler para gerar uma nova coluna consolidada.

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
Editar e Executar Código