使用 PCA 進行資料遮蔽
許多公司廣泛使用 PCA 進行偽匿名化。你可以在 Kaggle 上找到多個挑戰與資料集,其資料都是經過 PCA 轉換後提供的。
在 diffprivlib 的 models 模組中也包含了差分隱私版本的 PCA。它以 sklearn 的 PCA 類別為基礎,並加入 epsilon、最小與最大界限等可選引數,就像我們在前一章看到的一樣。
在這個練習中,你將對已載入為 players 的 NBA 薪資資料集套用 PCA 的資料遮蔽。
本練習屬於課程
Data Privacy and Anonymization in Python
練習說明
- 從
sklearn匯入PCA。 - 以與欄數相同的元件數初始化
PCA()。 - 對
players套用pca。 - 檢視產生的資料集。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))