Assembler un vecteur
La dernière étape de Pipeline consiste à regrouper toutes les colonnes contenant nos caractéristiques dans une seule colonne. Cette opération doit être effectuée avant la modélisation, car toutes les routines de modélisation Spark requièrent que les données soient présentées sous cette forme. Vous pouvez procéder en enregistrant chacune des valeurs d'une colonne sous forme d'entrée dans un vecteur. Ensuite, du point de vue du modèle, chaque observation est un vecteur qui contient toutes les informations la concernant et une étiquette qui indique au modélisateur à quelle valeur cette observation correspond.
Pour cette raison, le sous-module pyspark.ml.feature contient une classe appelée VectorAssembler. Cette fonction Transformer prend toutes les colonnes que vous spécifiez et les combine dans une nouvelle colonne vectorielle.
Cet exercice fait partie du cours
<cours>Principes fondamentaux de PySpark</cours>Instructions de l’exercice
Veuillez créer un
VectorAssembleren appelantVectorAssembler()avec les nomsinputColssous forme de liste et le nom deoutputCol"features".- La liste des colonnes doit être la suivante :
["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].
- La liste des colonnes doit être la suivante :
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)