过滤法与包裹法
在机器学习面试中,关于如何降低数据集维度的问题非常常见。降低维度的一种方法是仅选择数据集中与任务相关的特征。
在本练习中,您将先在 diabetes 数据框上实践一种过滤法,然后练习包含交叉验证的两种不同风格的包裹法。您将使用 pandas、matplotlib.pyplot 和 seaborn 来可视化相关性、处理数据,并将特征选择技术应用到数据集上。
已将去除目标变量列(progression)后的特征矩阵加载为 X,目标变量加载为 y。
请注意,pandas、matplotlib.pyplot 和 seaborn 已在您的工作空间中导入,并分别起别名为 pd、plt 和 sns。
请留意,您已在流程中加入了一个 Cross-validate 步骤(适用于最后 3 个步骤):

本练习是课程的一部分
用 Python 练习机器学习面试题
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create correlation matrix and print it
cor = ____.____()
print(____)
# Correlation matrix heatmap
plt.figure()
sns.____(____, annot=True, cmap=plt.cm.Reds)
plt.show()
# Correlation with output variable
cor_target = abs(cor["progression"])
# Selecting highly correlated features
best_features = ____[____ > ____]
print(____)