分類預測
在模型驗證中,光知道最終的分類結果還不夠,通常也需要了解預測背後的機率。就像預測哪一隊會贏球時,多數人也關心「贏的機率有多高」。
| 機率 | 預測 | 意義 |
|---|---|---|
| 0 < .50 | 0 | 球隊輸 |
| .50 + | 1 | 球隊贏 |
在本練習中,你會使用 tic_tac_toe 資料集,觀察 .predict() 與 .predict_proba() 兩個方法。第一個方法會預測玩家一是否會贏,第二個方法則會提供玩家一獲勝的機率。請使用 rfc 作為隨機森林分類模型。
本練習屬於課程
Python 的模型驗證
練習說明
- 建立兩個預測陣列:一個放分類結果值,另一個放預測機率。
- 對 pandas Series 使用
.value_counts()方法,列印各類別被指派的觀測數量。 - 列印
probability_predictions的第一筆觀測,看看機率的結構。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Fit the rfc model.
rfc.fit(X_train, y_train)
# Create arrays of predictions
classification_predictions = rfc.____(X_test)
probability_predictions = rfc.____(X_test)
# Print out count of binary predictions
print(pd.Series(____).____())
# Print the first value from probability_predictions
print('The first predicted probabilities are: {}'.format(____[____]))