Mascarea datelor cu PCA
PCA pentru pseudo-anonimizare este utilizat pe scară largă de numeroase companii. Poți găsi multiple competiții și seturi de date pe Kaggle unde datele sunt furnizate după transformări PCA.
O versiune a PCA cu confidențialitate diferențială este inclusă și în diffprivlib, în modulul models. Se bazează pe clasa PCA din sklearn, adăugând argumente opționale pentru epsilon și limitele minime și maxime — la fel cum am văzut în capitolul anterior.
În acest exercițiu, vei aplica mascarea datelor cu PCA pe setul de date NBA Salaries, deja încărcat sub numele players.
Acest exercițiu face parte din cursul
Confidențialitatea datelor și anonimizarea în Python
Instrucțiuni pentru exercițiu
- Importă
PCAdinsklearn. - Inițializează
PCA()cu numărul de componente egal cu numărul de coloane. - Aplică
pcapeplayers. - Observă setul de date rezultat.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))