Evaluarea și compararea algoritmilor
Acum că am creat un model nou cu GBTRegressor, este momentul să îl comparăm cu modelul de referință RandomForestRegressor. Pentru aceasta, vom compara predicțiile ambelor modele cu datele reale și vom calcula RMSE și R^2.
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Importă
RegressionEvaluatordinpyspark.ml.evaluationpentru a-l putea folosi ulterior. - Inițializează
RegressionEvaluatorsetândlabelColla datele noastre reale,SALESCLOSEPRICE, șipredictionColla datele noastre prezise,Prediction_Price. - Pentru a calcula metricile, apelează
evaluatepeevaluatorcu valorile de predicțiepredsși creează un dicționar cu cheiaevaluator.metricNameși valoarearmse, apoi fă același lucru pentru metricar2.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))