Créer un modèle de régression
L'un des grands avantages du module PySpark ML est que la plupart des algorithmes peuvent être essayés et testés sans changer beaucoup de code. La régression par forêt aléatoire est un modèle d'ensemble assez simple qui utilise l'ensachage (bagging) pour l'ajustement. Un autre modèle d'ensemble basé sur des arbres est Gradient Boosted Trees, qui utilise une approche différente appelée rehaussement (boosting) pour l'ajustement. Dans cet exercice, entraînons un GBTRegressor.
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- Importez
GBTRegressordepuispyspark.ml.regression, qui est le même module queRandomForestRegressor. - Instanciez
GBTRegressoravecfeaturesColdéfini sur la colonne vecteur de nos caractéristiques appeléefeatures,labelColdéfini sur notre variable dépendanteSALESCLOSEPRICE, et la valeur aléatoireseedà42. - Entraînez le modèle en appelant
fit()surgbtavec les données d'entraînement importées,train_df.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)