評估 Random Forest
在這個最後的練習中,你將評估對 Random Forest 模型進行交叉驗證後的結果。
以下物件已經建立完成:
cv—— 已經擬合訓練資料的交叉驗證器evaluator—— 一個BinaryClassificationEvaluator物件,以及flights_test—— 測試資料。
本練習屬於課程
使用 PySpark 的機器學習
練習說明
- 印出參數網格中所有模型的平均 AUC 指標清單。
- 顯示最佳模型的平均 AUC。這會是清單中「最大」的 AUC。
- 印出最佳模型中
maxDepth與featureSubsetStrategy參數的說明。 - 顯示最佳模型在測試資料上的預測 AUC。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Average AUC for each parameter combination in grid
print(cv.____)
# Average AUC for the best model
print(____(____))
# What's the optimal parameter value for maxDepth?
print(cv.____.explainParam('____'))
# What's the optimal parameter value for featureSubsetStrategy?
print(cv.____.____(____))
# AUC for best model on testing data
print(evaluator.____(____.____(____)))