Збирання стовпців
Останній етап підготовки даних — обʼєднати всі стовпці‑предиктори в один стовпець.
Оновлена версія даних flights, яка враховує всі зміни з попередніх вправ, має такі стовпці‑предиктори:
mon,domтаdowcarrier_idx(проіндексоване значення зcarrier)org_idx(проіндексоване значення зorg)kmdepartduration
Примітка: аргумент truncate=False у методі show() запобігає обрізанню даних у виведенні.
Ця вправа є частиною курсу
Machine Learning з PySpark
Інструкції до вправи
- Імпортуйте клас, який збиратиме предиктори.
- Створіть обʼєкт assembler, що дасть змогу обʼєднати стовпці‑предиктори в один стовпець.
- Скористайтеся assembler, щоб згенерувати новий зведений стовпець.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import the necessary class
from pyspark.ml.feature import ____
# Create an assembler object
assembler = ____(inputCols=[
____
], outputCol='features')
# Consolidate predictor columns
flights_assembled = assembler.____(____)
# Check the resulting column
flights_assembled.select('features', 'delay').show(5, truncate=False)