Évaluer et comparer des algorithmes
Maintenant que nous avons créé un nouveau modèle avec GBTRegressor, il est temps de le comparer à notre référence, RandomForestRegressor. Pour ce faire, nous allons comparer les prédictions des deux modèles aux données réelles et calculer le RMSE et R^2.
Cette activité fait partie du cours
Ingénierie des caractéristiques avec PySpark
Instructions de l’exercice
- Importez
RegressionEvaluatordepuispyspark.ml.evaluationpour pouvoir l'utiliser plus tard. - Initialisez
RegressionEvaluatoren définissantlabelColsur nos données réelles,SALESCLOSEPRICE, etpredictionColsur nos données prédites,Prediction_Price. - Pour calculer nos mesures, appelez
evaluatesurevaluatoravec les valeurs de prédictionpredset créez un dictionnaire dont la clé estevaluator.metricNameet la valeur estrmse. Faites la même chose pour la mesurer2.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))