CommencezCommencez gratuitement

Assembler un vecteur

La dernière étape du Pipeline consiste à regrouper toutes les colonnes de caractéristiques en une seule colonne. Il faut le faire avant l'étape de modélisation, car toutes les routines de modélisation de Spark s'attendent à recevoir les données dans ce format. Pour y arriver, on stocke chacune des valeurs d'une colonne comme une entrée dans un vecteur. Ainsi, du point de vue du modèle, chaque observation est un vecteur qui contient toute l'information la concernant ainsi qu'une étiquette indiquant à quel résultat cette observation correspond.

Pour cette raison, le sous-module pyspark.ml.feature comprend une classe appelée VectorAssembler. Ce Transformer prend toutes les colonnes que vous indiquez et les combine en une nouvelle colonne de type vecteur.

Cette activité fait partie du cours

Fondements de PySpark

Voir le cours

Instructions de l’exercice

  • Créez un VectorAssembler en appelant VectorAssembler() avec les inputCols sous forme de liste et le outputCol nommé "features".
    • La liste des colonnes doit être ["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)
Modifier et exécuter le code