Kom igångKom igång gratis

Modell för flygtid: Pipeline-modell

Nu är det dags att sätta ihop de här stegen i en pipeline.

Du skapar pipeline:n och tränar den sedan på träningsdata. Det innebär att varje enskilt steg i pipeline:n tillämpas på träningsdata i tur och ordning. Testdata exponeras inte för något av stegen: det förekommer ingen dataläcka!

När hela pipeline:n är tränad används den för att göra förutsägelser på testdata.

Data finns tillgängliga som flights, som har delats slumpmässigt i flights_train och flights_test.

Den här övningen är en del av kursen

Maskininlärning med PySpark

Visa kurs

Övningsinstruktioner

  • Importera klassen för att skapa en pipeline.
  • Skapa ett pipeline-objekt och ange stegen indexer, onehot, assembler och regression i den här ordningen.
  • Träna pipeline:n på träningsdata.
  • Gör förutsägelser på testdata.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import class for creating a pipeline
from pyspark.____ import ____

# Construct a pipeline
pipeline = ____(____=[____])

# Train the pipeline on the training data
pipeline = pipeline.____(____)

# Make predictions on the testing data
predictions = ____.____(____)
Redigera och kör kod