Оцінювання й порівняння алгоритмів
Тепер, коли ми створили нову модель за допомогою GBTRegressor, час порівняти її з базовою моделлю RandomForestRegressor. Для цього ми порівняємо прогнози обох моделей з фактичними даними та обчислимо RMSE і R^2.
Ця вправа є частиною курсу
Опрацювання ознак у PySpark
Інструкції до вправи
- Імпортуйте
RegressionEvaluatorзpyspark.ml.evaluation, щоб мати його доступним далі. - Ініціалізуйте
RegressionEvaluator, встановившиlabelColна наші фактичні даніSALESCLOSEPRICE, аpredictionCol— на наші прогнозні даніPrediction_Price. - Щоб обчислити метрики, викличте
evaluateна обʼєктіevaluatorіз прогнозамиpredsта створіть словник з ключемevaluator.metricNameі значеннямrmse; виконайте те саме для метрикиr2.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))