Créer un modèle de régression
L’un des grands avantages du module ML de PySpark est que la plupart des algorithmes peuvent être testés sans modifier beaucoup de code. La régression par forêts aléatoires est un modèle d’ensemble relativement simple, qui utilise le bagging pour l’ajustement. Un autre modèle d’ensemble basé sur les arbres est Gradient Boosted Trees, qui utilise une approche différente appelée boosting. Dans cet exercice, entraînons un GBTRegressor.
Cet exercice fait partie du cours
<cours>Feature Engineering avec PySpark</cours>Instructions de l’exercice
- Importez
GBTRegressordepuispyspark.ml.regression, qui est le même module queRandomForestRegressor. - Instanciez
GBTRegressoravecfeaturesColdéfini sur la colonne vecteur de nos variables explicatives,features,labelColdéfini sur notre variable dépendante,SALESCLOSEPRICE, et leseedaléatoire à42. - Entraînez le modèle en appelant
fit()surgbtavec les données d’entraînement importées,train_df.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from ____ import ____
# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
labelCol=____,
predictionCol="Prediction_Price",
seed=____
)
# Train model.
model = gbt.fit(train_df)