Utvärdera och jämföra algoritmer
Nu när vi har skapat en ny modell med GBTRegressor är det dags att jämföra den med vår baslinje RandomForestRegressor. Vi gör detta genom att jämföra bägge modellers prediktioner med de faktiska värdena och beräkna RMSE och R^2.
Den här övningen är en del av kursen
Feature Engineering med PySpark
Övningsinstruktioner
- Importera
RegressionEvaluatorfrånpyspark.ml.evaluationså att den finns tillgänglig att använda senare. - Initiera
RegressionEvaluatorgenom att sättalabelColtill våra faktiska data,SALESCLOSEPRICE, ochpredictionColtill våra predikterade data,Prediction_Price. - För att beräkna våra mätvärden anropar du
evaluatepåevaluatormed prediiktionsvärdenapredsoch skapar ett dictionary med nyckelnevaluator.metricNameoch värdetrmse– gör sedan samma sak för måttetr2.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))