開始使用免費開始

使用 PCA 進行資料遮蔽

許多公司廣泛使用 PCA 進行偽匿名化。你可以在 Kaggle 上找到多個挑戰與資料集,其資料都是經過 PCA 轉換後提供的。

diffprivlibmodels 模組中也包含了差分隱私版本的 PCA。它以 sklearnPCA 類別為基礎,並加入 epsilon、最小與最大界限等可選引數,就像我們在前一章看到的一樣。

在這個練習中,你將對已載入為 players 的 NBA 薪資資料集套用 PCA 的資料遮蔽。

本練習屬於課程

Data Privacy and Anonymization in Python

檢視課程

練習說明

  • sklearn 匯入 PCA
  • 以與欄數相同的元件數初始化 PCA()
  • players 套用 pca
  • 檢視產生的資料集。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
編輯並執行程式碼