ÎncepețiÎncepe gratuit

Mascarea datelor cu PCA

PCA pentru pseudo-anonimizare este utilizat pe scară largă de numeroase companii. Poți găsi multiple competiții și seturi de date pe Kaggle unde datele sunt furnizate după transformări PCA.

O versiune a PCA cu confidențialitate diferențială este inclusă și în diffprivlib, în modulul models. Se bazează pe clasa PCA din sklearn, adăugând argumente opționale pentru epsilon și limitele minime și maxime — la fel cum am văzut în capitolul anterior.

În acest exercițiu, vei aplica mascarea datelor cu PCA pe setul de date NBA Salaries, deja încărcat sub numele players.

Acest exercițiu face parte din cursul

Confidențialitatea datelor și anonimizarea în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă PCA din sklearn.
  • Inițializează PCA() cu numărul de componente egal cu numărul de coloane.
  • Aplică pca pe players.
  • Observă setul de date rezultat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
Editează și rulează codul