开始使用免费开始使用

使用 PCA 进行数据掩蔽

许多公司广泛使用 PCA 进行伪匿名化。您可以在 Kaggle 上找到多个挑战和数据集,其数据都是经过 PCA 变换后提供的。

diffprivlibmodels 模块也包含差分隐私版本的 PCA。它基于 sklearnPCA 类,但增加了可选参数,如 epsilon 以及最小和最大边界,正如我们在上一章中所见。

在本练习中,您将对已加载为 players 的 NBA 薪资数据集应用基于 PCA 的数据掩蔽。

本练习是课程的一部分

Python 中的数据隐私与匿名化

查看课程

练习说明

  • sklearn 导入 PCA
  • 初始化 PCA(),将组件数设置为与列数相同。
  • pca 应用于 players
  • 查看生成的数据集。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
编辑并运行代码