对重要特征排序
除了其他优点外,决策树之所以非常流行,很大程度上是因为其可解释性。许多模型都能给出准确预测,但决策树还能量化各个特征对目标的影响。在这里,它可以告诉您哪些特征对员工是否离职的决策影响最大或最小。在 sklearn 中,您可以通过 feature_importances_ 属性获取这些信息。
在本练习中,您将提取每个特征的量化重要性,将其保存到一个 pandas DataFrame(Python 风格的表格)中,并按从最重要到较不重要的顺序进行排序。前面练习中使用的 model_ best 决策树分类器已在您的工作区中可用,features_test 和 features_train 变量也已提供。
已将 pandas 以 pd 的别名导入。
本练习是课程的一部分
HR Analytics:用 Python 预测员工流失
练习说明
- 使用
feature_importances_属性计算相对特征重要性 - 创建特征列表
- 使用
DataFrame()函数将结果保存到一个 DataFrame 中,其中行是特征,各自的取值为一列 - 使用
sort_values()对relative_importancesDataFrame 排序,将最重要的特征置于顶部,并打印结果
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Calculate feature importances
feature_importances = model_best.____
# Create a list of features: done
feature_list = list(features)
# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])
# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)