CommencerCommencez gratuitement

Créer le pipeline

Vous êtes enfin prêt à créer un Pipeline !

Pipeline est une classe du module pyspark.ml qui regroupe toutes les classes Estimators et Transformers que vous avez déjà créées. Cela vous permet de réutiliser le même processus de modélisation à plusieurs reprises en l'intégrant dans un objet simple. Intéressant, n'est-ce pas ?

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Importez Pipeline à partir de pyspark.ml.

  • Veuillez appeler le constructeur Pipeline() avec l'argument clé stages pour créer un objet Pipeline nommé flights_pipe.

    • stages devrait être une liste contenant toutes les étapes que vous souhaitez que vos données suivent dans le pipeline. Voici : [dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import Pipeline
from ____ import ____

# Make the pipeline
flights_pipe = Pipeline(stages=____)
Modifier et exécuter le code