使用 PCA 进行数据掩蔽
许多公司广泛使用 PCA 进行伪匿名化。您可以在 Kaggle 上找到多个挑战和数据集,其数据都是经过 PCA 变换后提供的。
diffprivlib 的 models 模块也包含差分隐私版本的 PCA。它基于 sklearn 的 PCA 类,但增加了可选参数,如 epsilon 以及最小和最大边界,正如我们在上一章中所见。
在本练习中,您将对已加载为 players 的 NBA 薪资数据集应用基于 PCA 的数据掩蔽。
本练习是课程的一部分
Python 中的数据隐私与匿名化
练习说明
- 从
sklearn导入PCA。 - 初始化
PCA(),将组件数设置为与列数相同。 - 将
pca应用于players。 - 查看生成的数据集。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))