開始使用免費開始

評估與比較演算法

我們已經用 GBTRegressor 建立了一個新模型,現在該把它拿來和 RandomForestRegressor 的基準模型比較。做法是把兩個模型的預測結果與實際資料相比,並計算 RMSE 和 R^2。

本練習屬於課程

使用 PySpark 進行特徵工程

檢視課程

練習說明

  • pyspark.ml.evaluation 匯入 RegressionEvaluator,以便稍後使用。
  • 初始化 RegressionEvaluator,將 labelCol 設為實際資料 SALESCLOSEPRICE,將 predictionCol 設為預測資料 Prediction_Price
  • 若要計算指標,在 evaluator 上以預測值 preds 呼叫 evaluate,並建立一個字典,其鍵為 evaluator.metricName、值為 rmse;對 r2 指標也做相同的事。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

from ____ import ____

# Select columns to compute test error
evaluator = ____(____=____, 
                                ____=____)
# Dictionary of model predictions to loop over
models = {'Gradient Boosted Trees': gbt_predictions, 'Random Forest Regression': rfr_predictions}
for key, preds in models.items():
  # Create evaluation metrics
  rmse = evaluator.____(____, {____: ____})
  r2 = evaluator.____(____, {____: ____})
  
  # Print Model Metrics
  print(key + ' RMSE: ' + str(rmse))
  print(key + ' R^2: ' + str(r2))
編輯並執行程式碼