Algoritmen evalueren en vergelijken
Nu we een nieuw model hebben gemaakt met GBTRegressor, is het tijd om het te vergelijken met onze baseline RandomForestRegressor. We doen dit door de voorspellingen van beide modellen te vergelijken met de echte data en RMSE en R^2 te berekenen.
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Importeer
RegressionEvaluatoruitpyspark.ml.evaluationzodat deze later beschikbaar is. - Initialiseer
RegressionEvaluatordoorlabelColin te stellen op onze echte data,SALESCLOSEPRICE, enpredictionColop onze voorspelde data,Prediction_Price. - Om onze metrics te berekenen, roep je
evaluateaan opevaluatormet de voorspellingenpredsen maak je een dictionary met sleutelevaluator.metricNameen waardermse; doe hetzelfde voor der2-metric.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))