CommencerCommencez gratuitement

Créer un modèle de régression

L’un des grands avantages du module ML de PySpark est que la plupart des algorithmes peuvent être testés sans modifier beaucoup de code. La régression par forêts aléatoires est un modèle d’ensemble relativement simple, qui utilise le bagging pour l’ajustement. Un autre modèle d’ensemble basé sur les arbres est Gradient Boosted Trees, qui utilise une approche différente appelée boosting. Dans cet exercice, entraînons un GBTRegressor.

Cet exercice fait partie du cours

<cours>Feature Engineering avec PySpark</cours>
Voir le cours

Instructions de l’exercice

  • Importez GBTRegressor depuis pyspark.ml.regression, qui est le même module que RandomForestRegressor.
  • Instanciez GBTRegressor avec featuresCol défini sur la colonne vecteur de nos variables explicatives, features, labelCol défini sur notre variable dépendante, SALESCLOSEPRICE, et le seed aléatoire à 42.
  • Entraînez le modèle en appelant fit() sur gbt avec les données d’entraînement importées, train_df.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Modifier et exécuter le code