Zacznij terazZacznij za darmo

Tworzenie potoku

Czas na stworzenie Pipeline!

Pipeline to klasa z modułu pyspark.ml, która łączy wszystkie Estimators i Transformers, które już wcześniej przygotowałeś. Dzięki temu możesz wielokrotnie używać tego samego procesu modelowania – wystarczy opakować go w jeden prosty obiekt. Wygodne, prawda?

To ćwiczenie jest częścią kursu

Podstawy PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj Pipeline z pyspark.ml.
  • Wywołaj konstruktor Pipeline() z argumentem kluczowym stages, aby utworzyć Pipeline o nazwie flights_pipe.
    • stages powinno być listą zawierającą wszystkie etapy, przez które mają przejść dane w potoku. W tym przypadku jest to: [dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import Pipeline
from ____ import ____

# Make the pipeline
flights_pipe = Pipeline(stages=____)
Edytuj i uruchom kod