CommencezCommencez gratuitement

Évaluer et comparer des algorithmes

Maintenant que nous avons créé un nouveau modèle avec GBTRegressor, il est temps de le comparer à notre référence, RandomForestRegressor. Pour ce faire, nous allons comparer les prédictions des deux modèles aux données réelles et calculer le RMSE et R^2.

Cette activité fait partie du cours

Ingénierie des caractéristiques avec PySpark

Voir le cours

Instructions de l’exercice

  • Importez RegressionEvaluator depuis pyspark.ml.evaluation pour pouvoir l'utiliser plus tard.
  • Initialisez RegressionEvaluator en définissant labelCol sur nos données réelles, SALESCLOSEPRICE, et predictionCol sur nos données prédites, Prediction_Price.
  • Pour calculer nos mesures, appelez evaluate sur evaluator avec les valeurs de prédiction preds et créez un dictionnaire dont la clé est evaluator.metricName et la valeur est rmse. Faites la même chose pour la mesure r2.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

from ____ import ____

# Select columns to compute test error
evaluator = ____(____=____, 
                                ____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
  # Create evaluation metrics
  rmse = evaluator.____(____, {____: ____})
  r2 = evaluator.____(____, {____: ____})
  
  # Print Model Metrics
  print(key + ' RMSE: ' + str(rmse))
  print(key + ' R^2: ' + str(r2))
Modifier et exécuter le code