Aan de slagBegin gratis

Algoritmen evalueren en vergelijken

Nu we een nieuw model hebben gemaakt met GBTRegressor, is het tijd om het te vergelijken met onze baseline RandomForestRegressor. We doen dit door de voorspellingen van beide modellen te vergelijken met de echte data en RMSE en R^2 te berekenen.

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Importeer RegressionEvaluator uit pyspark.ml.evaluation zodat deze later beschikbaar is.
  • Initialiseer RegressionEvaluator door labelCol in te stellen op onze echte data, SALESCLOSEPRICE, en predictionCol op onze voorspelde data, Prediction_Price.
  • Om onze metrics te berekenen, roep je evaluate aan op evaluator met de voorspellingen preds en maak je een dictionary met sleutel evaluator.metricName en waarde rmse; doe hetzelfde voor de r2-metric.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

from ____ import ____

# Select columns to compute test error
evaluator = ____(____=____, 
                                ____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
  # Create evaluation metrics
  rmse = evaluator.____(____, {____: ____})
  r2 = evaluator.____(____, {____: ____})
  
  # Print Model Metrics
  print(key + ' RMSE: ' + str(rmse))
  print(key + ' R^2: ' + str(r2))
Code bewerken en uitvoeren