Kom igångKom igång gratis

Datamaskering med PCA

PCA för pseudoanonymisering används i stor utsträckning av företag. Du hittar flera Kaggle-utmaningar och datamängder där datan tillhandahålls efter PCA-transformationer.

En differentiellt privat version av PCA finns också tillgänglig i diffprivlib under modulen models. Den bygger på klassen PCA från sklearn men inkluderar valfria argument för epsilon samt minimi- och maxgränser – precis som vi sett i föregående kapitel.

I den här övningen ska du tillämpa datamaskering med PCA på NBA-lönedata, som redan är inläst som players.

Den här övningen är en del av kursen

Dataintegritet och anonymisering i Python

Visa kurs

Övningsinstruktioner

  • Importera PCA från sklearn.
  • Initiera PCA() med antalet komponenter satt till samma antal som antalet kolumner.
  • Tillämpa pcaplayers.
  • Ta en titt på den resulterande datamängden.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
Redigera och kör kod