解读结果
了解哪些特征对您的预测影响最大几乎总是很重要的。也许结果与直觉相反,这本身就是一个洞见;也许只有少数特征贡献了模型的大部分准确率,您就无需再花时间去获取或清洗其他特征。
在这个示例中,我们将查看一个在没有任何 LISTPRICE 信息的情况下训练出的模型。在缺少该信息后,哪些因素对价格影响最大?
- 注意:特征重要性数组
importances已经为您通过model.featureImportances.toArray()创建好了。
本练习是课程的一部分
使用 PySpark 进行特征工程
练习说明
- 使用
importances的取值创建一个pandas数据框,并通过设置参数columns将列名命名为importance。 - 使用导入的特征名称列表
feature_cols,用pd.Series()将其包装为一个新的pandas.Series,并赋值给列fi_df['feature']。 - 使用
sort_values()对数据框排序,将by参数设置为我们的importance列,并将ascending设为False以按降序排列。检查结果。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])
# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)
# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)
# Inspect Results
fi_df.head(10)