特征选择
在为建模准备数据时,务必要确保模型有一组有用的特征来支撑其预测(或诊断)。要做到有用,特征需要以相互独立(正交)的方式捕捉心脏病数据集的关键信息;数据并非越多越好!
您可以使用 sklearn.feature_selection.SelectFromModel 模块来选择有用的特征。SelectFromModel 实现了一种基于 RandomForestClassifier 的"穷举式"方法,用于找出完成心脏病诊断任务时最显著的特征。
RandomForestClassifier 已经导入,心脏病数据的特征和目标也分别作为 X_train 和 y_train 导入。
本练习是课程的一部分
端到端机器学习
交互式实操练习
通过完成这段示例代码来试试这个练习。
from sklearn.feature_selection import SelectFromModel
# Define the random forest model and fit to the training data
rf = ____(____=____, ____=____, ____=____)
rf.____(____, ____)