Modell för flygtid: Pipeline-modell
Nu är det dags att sätta ihop de här stegen i en pipeline.
Du skapar pipeline:n och tränar den sedan på träningsdata. Det innebär att varje enskilt steg i pipeline:n tillämpas på träningsdata i tur och ordning. Testdata exponeras inte för något av stegen: det förekommer ingen dataläcka!
När hela pipeline:n är tränad används den för att göra förutsägelser på testdata.
Data finns tillgängliga som flights, som har delats slumpmässigt i flights_train och flights_test.
Den här övningen är en del av kursen
Maskininlärning med PySpark
Övningsinstruktioner
- Importera klassen för att skapa en pipeline.
- Skapa ett pipeline-objekt och ange stegen
indexer,onehot,assemblerochregressioni den här ordningen. - Träna pipeline:n på träningsdata.
- Gör förutsägelser på testdata.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import class for creating a pipeline
from pyspark.____ import ____
# Construct a pipeline
pipeline = ____(____=[____])
# Train the pipeline on the training data
pipeline = pipeline.____(____)
# Make predictions on the testing data
predictions = ____.____(____)