开始使用免费开始使用

对重要特征排序

除了其他优点外,决策树之所以非常流行,很大程度上是因为其可解释性。许多模型都能给出准确预测,但决策树还能量化各个特征对目标的影响。在这里,它可以告诉您哪些特征对员工是否离职的决策影响最大或最小。在 sklearn 中,您可以通过 feature_importances_ 属性获取这些信息。

在本练习中,您将提取每个特征的量化重要性,将其保存到一个 pandas DataFrame(Python 风格的表格)中,并按从最重要到较不重要的顺序进行排序。前面练习中使用的 model_ best 决策树分类器已在您的工作区中可用,features_testfeatures_train 变量也已提供。

已将 pandaspd 的别名导入。

本练习是课程的一部分

HR Analytics:用 Python 预测员工流失

查看课程

练习说明

  • 使用 feature_importances_ 属性计算相对特征重要性
  • 创建特征列表
  • 使用 DataFrame() 函数将结果保存到一个 DataFrame 中,其中行是特征,各自的取值为一列
  • 使用 sort_values()relative_importances DataFrame 排序,将最重要的特征置于顶部,并打印结果

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Calculate feature importances
feature_importances = model_best.____

# Create a list of features: done
feature_list = list(features)

# Save the results inside a DataFrame using feature_list as an index
relative_importances = pd.____(index=____, data=feature_importances, columns=["importance"])

# Sort values to learn most important features
relative_importances.____(by="importance", ascending=False)
编辑并运行代码