Datamaskering med PCA
PCA för pseudoanonymisering används i stor utsträckning av företag. Du hittar flera Kaggle-utmaningar och datamängder där datan tillhandahålls efter PCA-transformationer.
En differentiellt privat version av PCA finns också tillgänglig i diffprivlib under modulen models. Den bygger på klassen PCA från sklearn men inkluderar valfria argument för epsilon samt minimi- och maxgränser – precis som vi sett i föregående kapitel.
I den här övningen ska du tillämpa datamaskering med PCA på NBA-lönedata, som redan är inläst som players.
Den här övningen är en del av kursen
Dataintegritet och anonymisering i Python
Övningsinstruktioner
- Importera
PCAfrånsklearn. - Initiera
PCA()med antalet komponenter satt till samma antal som antalet kolumner. - Tillämpa
pcapåplayers. - Ta en titt på den resulterande datamängden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))