用 PCA 可视化类别分离 I
在机器学习面试中,常见问题之一是:在进行 PCA 后如何可视化数据的降维结果。本练习将通过绘制 loan_data 的前 2 个主成分,来观察在"贷款状态是否已全额还清或核销"这一标签下,两类在这两个主成分上的分离情况。
loan_data 数据集已完成缩放和独热编码,也就是将分类变量转换为二元指示变量。这样在进行 PCA 之前,所有特征既是数值型,也处于相同量纲。
我们已为您准备好包含 2 个主成分的 PCA 模型,并设置好了带有 x、y 轴标签和标题的绘图。您将在练习中使用名为 loan_data_PCA 的 DataFrame。目标变量 Loan Status 的取值为 0 和 1。您将把 PC1 画在 x 轴,把 PC2 画在 y 轴。
已为您导入 matplotlib.pyplot 为 plt、seaborn 为 sns,以及从 sklearn.decomposition 导入的 PCA。
本练习是课程的一部分
用 Python 练习机器学习面试题
交互式实操练习
通过完成这段示例代码来试试这个练习。
targets = [____, ____]
colors = ['r', 'b']
# For loop to create plot
for target, color in zip(____, ____):
indicesToKeep = ____['____'] == ____