Vyhodnocení a porovnání algoritmů
Teď, když máme nový model s GBTRegressor, je čas porovnat ho s naším základním modelem RandomForestRegressor. Porovnáme predikce obou modelů se skutečnými daty a vypočítáme RMSE a R^2.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Importuj
RegressionEvaluatorzpyspark.ml.evaluation, aby byl dostupný pro další použití. - Inicializuj
RegressionEvaluatortak, že nastavíšlabelColna naše skutečná data,SALESCLOSEPRICE, apredictionColna naše predikovaná data,Prediction_Price. - Pro výpočet metrik zavolej
evaluatena objektuevaluators hodnotami predikcípredsa vytvoř slovník s klíčemevaluator.metricNamea hodnotourmse, totéž proveď pro metrikur2.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))