CommencerCommencez gratuitement

Assembler un vecteur

La dernière étape de Pipeline consiste à regrouper toutes les colonnes contenant nos caractéristiques dans une seule colonne. Cette opération doit être effectuée avant la modélisation, car toutes les routines de modélisation Spark requièrent que les données soient présentées sous cette forme. Vous pouvez procéder en enregistrant chacune des valeurs d'une colonne sous forme d'entrée dans un vecteur. Ensuite, du point de vue du modèle, chaque observation est un vecteur qui contient toutes les informations la concernant et une étiquette qui indique au modélisateur à quelle valeur cette observation correspond.

Pour cette raison, le sous-module pyspark.ml.feature contient une classe appelée VectorAssembler. Cette fonction Transformer prend toutes les colonnes que vous spécifiez et les combine dans une nouvelle colonne vectorielle.

Cet exercice fait partie du cours

<cours>Principes fondamentaux de PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Veuillez créer un VectorAssembler en appelant VectorAssembler() avec les noms inputCols sous forme de liste et le nom de outputCol "features".

    • La liste des colonnes doit être la suivante : ["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)
Modifier et exécuter le code