Valutare e confrontare gli algoritmi
Ora che abbiamo creato un nuovo modello con GBTRegressor, è il momento di confrontarlo con il nostro baseline RandomForestRegressor. Per farlo confronteremo le previsioni di entrambi i modelli con i dati reali e calcoleremo RMSE e R^2.
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Importa
RegressionEvaluatordapyspark.ml.evaluationcosì da poterlo usare in seguito. - Inizializza
RegressionEvaluatorimpostandolabelColai nostri dati reali,SALESCLOSEPRICE, epredictionColai nostri dati previsti,Prediction_Price. - Per calcolare le metriche, chiama
evaluatesuevaluatorcon i valori previstipredse crea un dizionario con chiaveevaluator.metricNamee valorermse; fai lo stesso per la metricar2.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))