Créer le pipeline
Vous êtes enfin prêt à créer un Pipeline!
Pipeline est une classe du module pyspark.ml qui regroupe tous les Estimators et Transformers que vous avez déjà créés. Cela vous permet de réutiliser exactement le même processus de modélisation encore et encore en l'encapsulant dans un seul objet simple. Pratique, n'est-ce pas?
Cette activité fait partie du cours
Fondements de PySpark
Instructions de l’exercice
- Importez
Pipelinedepuispyspark.ml. - Appelez le constructeur
Pipeline()avec l'argument nomméstagespour créer unPipelinenomméflights_pipe.stagesdoit être une liste contenant toutes les étapes que vous voulez que vos données traversent dans le pipeline. Ici, il s'agit simplement de :[dest_indexer, dest_encoder, carr_indexer, carr_encoder, vec_assembler]
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import Pipeline
from ____ import ____
# Make the pipeline
flights_pipe = Pipeline(stages=____)