LoslegenKostenlos starten

Algorithmen bewerten und vergleichen

Jetzt, wo wir mit GBTRegressor ein neues Modell erstellt haben, ist es Zeit, es mit unserer Baseline RandomForestRegressor zu vergleichen. Dazu vergleichen wir die Vorhersagen beider Modelle mit den tatsächlichen Daten und berechnen RMSE und R^2.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere RegressionEvaluator aus pyspark.ml.evaluation, damit er später verfügbar ist.
  • Initialisiere RegressionEvaluator, indem du labelCol auf unsere echten Daten SALESCLOSEPRICE setzt und predictionCol auf unsere vorhergesagten Daten Prediction_Price.
  • Um unsere Metriken zu berechnen, rufe evaluate auf evaluator mit den Vorhersagewerten preds auf und erstelle ein Dictionary mit dem Schlüssel evaluator.metricName und dem Wert rmse; mache dasselbe für die Metrik r2.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

from ____ import ____

# Select columns to compute test error
evaluator = ____(____=____, 
                                ____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
  # Create evaluation metrics
  rmse = evaluator.____(____, {____: ____})
  r2 = evaluator.____(____, {____: ____})
  
  # Print Model Metrics
  print(key + ' RMSE: ' + str(rmse))
  print(key + ' R^2: ' + str(r2))
Code bearbeiten und ausführen