Créer le pipeline
Vous êtes enfin prêt à créer un Pipeline !
Pipeline est une classe du module pyspark.ml qui regroupe toutes les classes Estimators et Transformers que vous avez déjà créées. Cela vous permet de réutiliser le même processus de modélisation à plusieurs reprises en l'intégrant dans un objet simple. Intéressant, n'est-ce pas ?
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Instructions de l’exercice
Importez
Pipelineà partir depyspark.ml.Veuillez appeler le constructeur
Pipeline()avec l'argument cléstagespour créer un objetPipelinenomméflights_pipe.stagesdevrait être une liste contenant toutes les étapes que vous souhaitez que vos données suivent dans le pipeline. Voici :[dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import Pipeline
from ____ import ____
# Make the pipeline
flights_pipe = Pipeline(stages=____)