CommencezCommencez gratuitement

Créer le pipeline

Vous êtes enfin prêt à créer un Pipeline!

Pipeline est une classe du module pyspark.ml qui regroupe tous les Estimators et Transformers que vous avez déjà créés. Cela vous permet de réutiliser exactement le même processus de modélisation encore et encore en l'encapsulant dans un seul objet simple. Pratique, n'est-ce pas?

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Instructions de l’exercice

  • Importez Pipeline depuis pyspark.ml.
  • Appelez le constructeur Pipeline() avec l'argument nommé stages pour créer un Pipeline nommé flights_pipe.
    • stages doit être une liste contenant toutes les étapes que vous voulez que vos données traversent dans le pipeline. Ici, il s'agit simplement de : [dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import Pipeline
from ____ import ____

# Make the pipeline
flights_pipe = Pipeline(stages=____)
Modifier et exécuter le code