主成分分析
在前面 2 个章节中,您已经看到多种降低数据集维度的方法,包括正则化和特征选择。在机器学习面试中,能够清晰解释降维的不同方面非常重要。数据集越大,计算时间越长;而数据中的噪声也可能导致结果偏差。
一种常见的降维方法是主成分分析(PCA)。它通过构造新的特征,在尽量保留数据集中最有用信息的同时,减少数据规模,并去除多重共线性。本练习中,您将使用 sklearn.decomposition 模块,对 diabetes 数据集的特征执行 PCA,并将目标变量 progression 单独隔离出来。
这是您在流水线中的位置:

本练习是课程的一部分
用 Python 练习机器学习面试题
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import module
from ____.____ import ____
# Feature matrix and target array
X = ____.____('____', axis=1)
y = ____['____']