CommencezCommencez gratuitement

Masquage de données avec la PCA

La PCA pour la pseudo-anonymisation est très utilisée en entreprise. Vous trouverez plusieurs défis et jeux de données sur Kaggle où les données sont fournies après des transformations PCA.

Une version différentiellement privée de la PCA est aussi offerte dans diffprivlib, dans le module models. Elle s'appuie sur la classe PCA de sklearn, mais ajoute des arguments optionnels pour epsilon ainsi que des bornes min et max, comme nous l'avons vu au chapitre précédent.

Dans cet exercice, vous allez appliquer un masquage de données avec la PCA sur l'ensemble de données des salaires de la NBA, déjà chargé sous le nom players.

Cette activité fait partie du cours

Confidentialité des données et anonymisation en Python

Voir le cours

Instructions de l’exercice

  • Importez PCA à partir de sklearn.
  • Initialisez PCA() avec un nombre de composantes égal au nombre de colonnes.
  • Appliquez pca à players.
  • Consultez l'ensemble de données obtenu.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import PCA from Scikit-learn
____

# Initialize PCA with number of components to be the same as the number of columns
pca = ____

# Apply PCA to the data
players_pca = ____

# Print the resulting dataset
print(pd.DataFrame(players_pca))
Modifier et exécuter le code