CommencezCommencez gratuitement

Créer un modèle de régression

L'un des grands avantages du module PySpark ML est que la plupart des algorithmes peuvent être essayés et testés sans changer beaucoup de code. La régression par forêt aléatoire est un modèle d'ensemble assez simple qui utilise l'ensachage (bagging) pour l'ajustement. Un autre modèle d'ensemble basé sur des arbres est Gradient Boosted Trees, qui utilise une approche différente appelée rehaussement (boosting) pour l'ajustement. Dans cet exercice, entraînons un GBTRegressor.

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Importez GBTRegressor depuis pyspark.ml.regression, qui est le même module que RandomForestRegressor.
  • Instanciez GBTRegressor avec featuresCol défini sur la colonne vecteur de nos caractéristiques appelée features, labelCol défini sur notre variable dépendante SALESCLOSEPRICE, et la valeur aléatoire seed à 42.
  • Entraînez le modèle en appelant fit() sur gbt avec les données d'entraînement importées, train_df.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from ____ import ____

# Train a Gradient Boosted Trees (GBT) model.
gbt = ____(featuresCol=____,
                           labelCol=____,
                           predictionCol="Prediction_Price",
                           seed=____
                           )

# Train model.
model = gbt.fit(train_df)
Modifier et exécuter le code