Объединение столбцов
Завершающий этап подготовки данных — объединить все столбцы с предикторами в один.
Обновлённая версия набора данных flights, учитывающая все изменения из предыдущих упражнений, содержит следующие столбцы с предикторами:
mon,domиdowcarrier_idx(индексированное значение изcarrier)org_idx(индексированное значение изorg)kmdepartduration
Примечание: Аргумент truncate=False в методе show() предотвращает усечение данных в выводе.
Это упражнение является частью курса
Машинное обучение с PySpark
Инструкции к упражнению
- Импортируйте класс, который будет объединять предикторы.
- Создайте объект-сборщик, который позволит объединить столбцы с предикторами в один столбец.
- Используйте сборщик, чтобы создать новый объединённый столбец.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)