評估與比較演算法
我們已經用 GBTRegressor 建立了一個新模型,現在該把它拿來和 RandomForestRegressor 的基準模型比較。做法是把兩個模型的預測結果與實際資料相比,並計算 RMSE 和 R^2。
本練習屬於課程
使用 PySpark 進行特徵工程
練習說明
- 從
pyspark.ml.evaluation匯入RegressionEvaluator,以便稍後使用。 - 初始化
RegressionEvaluator,將labelCol設為實際資料SALESCLOSEPRICE,將predictionCol設為預測資料Prediction_Price。 - 若要計算指標,在
evaluator上以預測值preds呼叫evaluate,並建立一個字典,其鍵為evaluator.metricName、值為rmse;對r2指標也做相同的事。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from ____ import ____
# Select columns to compute test error
evaluator = ____(____=____,
____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
# Create evaluation metrics
rmse = evaluator.____(____, {____: ____})
r2 = evaluator.____(____, {____: ____})
# Print Model Metrics
print(key + ' RMSE: ' + str(rmse))
print(key + ' R^2: ' + str(r2))