开始使用免费开始使用

过滤法与包裹法

在机器学习面试中,关于如何降低数据集维度的问题非常常见。降低维度的一种方法是仅选择数据集中与任务相关的特征。

在本练习中,您将先在 diabetes 数据框上实践一种过滤法,然后练习包含交叉验证的两种不同风格的包裹法。您将使用 pandasmatplotlib.pyplotseaborn 来可视化相关性、处理数据,并将特征选择技术应用到数据集上。

已将去除目标变量列(progression)后的特征矩阵加载为 X,目标变量加载为 y

请注意,pandasmatplotlib.pyplotseaborn 已在您的工作空间中导入,并分别起别名为 pdpltsns

请留意,您已在流程中加入了一个 Cross-validate 步骤(适用于最后 3 个步骤):

Machine learning pipeline

本练习是课程的一部分

用 Python 练习机器学习面试题

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create correlation matrix and print it
cor = ____.____()
print(____)

# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()

# Correlation with output variable
cor_target = abs(cor["progression"])

# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)
编辑并运行代码