Kom igångKom igång gratis

Utvärdera och jämföra algoritmer

Nu när vi har skapat en ny modell med GBTRegressor är det dags att jämföra den med vår baslinje RandomForestRegressor. Vi gör detta genom att jämföra bägge modellers prediktioner med de faktiska värdena och beräkna RMSE och R^2.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Importera RegressionEvaluator från pyspark.ml.evaluation så att den finns tillgänglig att använda senare.
  • Initiera RegressionEvaluator genom att sätta labelCol till våra faktiska data, SALESCLOSEPRICE, och predictionCol till våra predikterade data, Prediction_Price.
  • För att beräkna våra mätvärden anropar du evaluateevaluator med prediiktionsvärdena preds och skapar ett dictionary med nyckeln evaluator.metricName och värdet rmse – gör sedan samma sak för måttet r2.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from ____ import ____

# Select columns to compute test error
evaluator = ____(____=____, 
                                ____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
  # Create evaluation metrics
  rmse = evaluator.____(____, {____: ____})
  r2 = evaluator.____(____, {____: ____})
  
  # Print Model Metrics
  print(key + ' RMSE: ' + str(rmse))
  print(key + ' R^2: ' + str(r2))
Redigera och kör kod