ÎncepețiÎncepe gratuit

Evaluarea și compararea algoritmilor

Acum că am creat un model nou cu GBTRegressor, este momentul să îl comparăm cu modelul de referință RandomForestRegressor. Pentru aceasta, vom compara predicțiile ambelor modele cu datele reale și vom calcula RMSE și R^2.

Acest exercițiu face parte din cursul

Feature Engineering cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă RegressionEvaluator din pyspark.ml.evaluation pentru a-l putea folosi ulterior.
  • Inițializează RegressionEvaluator setând labelCol la datele noastre reale, SALESCLOSEPRICE, și predictionCol la datele noastre prezise, Prediction_Price.
  • Pentru a calcula metricile, apelează evaluate pe evaluator cu valorile de predicție preds și creează un dicționar cu cheia evaluator.metricName și valoarea rmse, apoi fă același lucru pentru metrica r2.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from ____ import ____

# Select columns to compute test error
evaluator = ____(____=____, 
                                ____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
  # Create evaluation metrics
  rmse = evaluator.____(____, {____: ____})
  r2 = evaluator.____(____, {____: ____})
  
  # Print Model Metrics
  print(key + ' RMSE: ' + str(rmse))
  print(key + ' R^2: ' + str(r2))
Editează și rulează codul