特徵選擇
在為模型準備資料時,很重要的一點是要確保有一組對模型做出預測(或診斷)有幫助的特徵。要做到有幫助,特徵需要以彼此正交的方式,捕捉心臟病資料集的關鍵特性;資料不是越多越好!
你可以使用 sklearn.feature_selection.SelectFromModel 模組來挑選有用的特徵。SelectFromModel 採用一種暴力式的方法,使用 RandomForestClassifier 模型來找出最適合心臟病診斷任務的關鍵特徵。
RandomForestClassifier 已經匯入,心臟病資料的特徵與目標也分別以 X_train 和 y_train 匯入。
本練習屬於課程
端到端機器學習
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)