Assembler un vecteur
La dernière étape du Pipeline consiste à regrouper toutes les colonnes de caractéristiques en une seule colonne. Il faut le faire avant l'étape de modélisation, car toutes les routines de modélisation de Spark s'attendent à recevoir les données dans ce format. Pour y arriver, on stocke chacune des valeurs d'une colonne comme une entrée dans un vecteur. Ainsi, du point de vue du modèle, chaque observation est un vecteur qui contient toute l'information la concernant ainsi qu'une étiquette indiquant à quel résultat cette observation correspond.
Pour cette raison, le sous-module pyspark.ml.feature comprend une classe appelée VectorAssembler. Ce Transformer prend toutes les colonnes que vous indiquez et les combine en une nouvelle colonne de type vecteur.
Cette activité fait partie du cours
Fondements de PySpark
Instructions de l’exercice
- Créez un
VectorAssembleren appelantVectorAssembler()avec lesinputColssous forme de liste et leoutputColnommé"features".- La liste des colonnes doit être
["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].
- La liste des colonnes doit être
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)