Tworzenie potoku
Czas na stworzenie Pipeline!
Pipeline to klasa z modułu pyspark.ml, która łączy wszystkie Estimators i Transformers, które już wcześniej przygotowałeś. Dzięki temu możesz wielokrotnie używać tego samego procesu modelowania – wystarczy opakować go w jeden prosty obiekt. Wygodne, prawda?
To ćwiczenie jest częścią kursu
Podstawy PySpark
Instrukcje do ćwiczenia
- Zaimportuj
Pipelinezpyspark.ml. - Wywołaj konstruktor
Pipeline()z argumentem kluczowymstages, aby utworzyćPipelineo nazwieflights_pipe.stagespowinno być listą zawierającą wszystkie etapy, przez które mają przejść dane w potoku. W tym przypadku jest to:[dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import Pipeline
from ____ import ____
# Make the pipeline
flights_pipe = Pipeline(stages=____)