НачатьНачать бесплатно

Создание конвейера

Теперь вы готовы создать Pipeline!

Pipeline — это класс из модуля pyspark.ml, который объединяет все созданные вами Estimators и Transformers. Он позволяет многократно применять один и тот же процесс моделирования, упаковав его в один простой объект. Удобно, не правда ли?

Это упражнение является частью курса

Основы PySpark

Посмотреть курс

Инструкции к упражнению

  • Импортируйте Pipeline из pyspark.ml.
  • Вызовите конструктор Pipeline() с именованным аргументом stages, чтобы создать объект Pipeline с именем flights_pipe.
    • stages должен быть списком всех этапов, через которые должны пройти данные в конвейере. В данном случае это: [dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import Pipeline
from ____ import ____

# Make the pipeline
flights_pipe = Pipeline(stages=____)
Редактировать и запускать код