开始使用免费开始使用

解读结果

了解哪些特征对您的预测影响最大几乎总是很重要的。也许结果与直觉相反,这本身就是一个洞见;也许只有少数特征贡献了模型的大部分准确率,您就无需再花时间去获取或清洗其他特征。

在这个示例中,我们将查看一个在没有任何 LISTPRICE 信息的情况下训练出的模型。在缺少该信息后,哪些因素对价格影响最大?

  • 注意:特征重要性数组 importances 已经为您通过 model.featureImportances.toArray() 创建好了。

本练习是课程的一部分

使用 PySpark 进行特征工程

查看课程

练习说明

  • 使用 importances 的取值创建一个 pandas 数据框,并通过设置参数 columns 将列名命名为 importance
  • 使用导入的特征名称列表 feature_cols,用 pd.Series() 将其包装为一个新的 pandas.Series,并赋值给列 fi_df['feature']
  • 使用 sort_values() 对数据框排序,将 by 参数设置为我们的 importance 列,并将 ascending 设为 False 以按降序排列。检查结果。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Convert feature importances to a pandas column
fi_df = pd.DataFrame(____, columns=[____])

# Convert list of feature names to pandas column
fi_df['feature'] = pd.____(____)

# Sort the data based on feature importance
fi_df.____(by=[____], ascending=____, inplace=True)

# Inspect Results
fi_df.head(10)
编辑并运行代码