Algorithmen bewerten und vergleichen
Jetzt, wo wir mit GBTRegressor ein neues Modell erstellt haben, ist es Zeit, es mit unserer Baseline RandomForestRegressor zu vergleichen. Dazu vergleichen wir die Vorhersagen beider Modelle mit den tatsächlichen Daten und berechnen RMSE und R^2.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Importiere
RegressionEvaluatorauspyspark.ml.evaluation, damit er später verfügbar ist. - Initialisiere
RegressionEvaluator, indem dulabelColauf unsere echten DatenSALESCLOSEPRICEsetzt undpredictionColauf unsere vorhergesagten DatenPrediction_Price. - Um unsere Metriken zu berechnen, rufe
evaluateaufevaluatormit den Vorhersagewertenpredsauf und erstelle ein Dictionary mit dem Schlüsselevaluator.metricNameund dem Wertrmse; mache dasselbe für die Metrikr2.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))