НачатьНачать бесплатно

Объединение столбцов

Завершающий этап подготовки данных — объединить все столбцы с предикторами в один.

Обновлённая версия набора данных flights, учитывающая все изменения из предыдущих упражнений, содержит следующие столбцы с предикторами:

  • mon, dom и dow
  • carrier_idx (индексированное значение из carrier)
  • org_idx (индексированное значение из org)
  • km
  • depart
  • duration

Примечание: Аргумент truncate=False в методе show() предотвращает усечение данных в выводе.

Это упражнение является частью курса

Машинное обучение с PySpark

Посмотреть курс

Инструкции к упражнению

  • Импортируйте класс, который будет объединять предикторы.
  • Создайте объект-сборщик, который позволит объединить столбцы с предикторами в один столбец.
  • Используйте сборщик, чтобы создать новый объединённый столбец.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import the necessary class
from pyspark.ml.feature import ____

# Create an assembler object
assembler = ____(inputCols=[
    ____
], outputCol='features')

# Consolidate predictor columns
flights_assembled = assembler.____(____)

# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)
Редактировать и запускать код