Skapa pipelinen
Nu är du äntligen redo att skapa en Pipeline!
Pipeline är en klass i modulen pyspark.ml som kombinerar alla Estimators och Transformers som du redan har skapat. Det gör att du kan återanvända samma modelleringsprocess om och om igen genom att samla allt i ett enkelt objekt. Smidigt, eller hur?
Den här övningen är en del av kursen
Grunderna i PySpark
Övningsinstruktioner
- Importera
Pipelinefrånpyspark.ml. - Anropa konstruktorn
Pipeline()med nyckelordsargumentetstagesför att skapa enPipelinemed namnetflights_pipe.stagesska vara en lista med alla steg som du vill att dina data ska gå igenom i pipelinen. Här är det:[dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import Pipeline
from ____ import ____
# Make the pipeline
flights_pipe = Pipeline(stages=____)