Masquage de données avec la PCA
La PCA pour la pseudo-anonymisation est très utilisée en entreprise. Vous trouverez plusieurs défis et jeux de données sur Kaggle où les données sont fournies après des transformations PCA.
Une version différentiellement privée de la PCA est aussi offerte dans diffprivlib, dans le module models. Elle s'appuie sur la classe PCA de sklearn, mais ajoute des arguments optionnels pour epsilon ainsi que des bornes min et max, comme nous l'avons vu au chapitre précédent.
Dans cet exercice, vous allez appliquer un masquage de données avec la PCA sur l'ensemble de données des salaires de la NBA, déjà chargé sous le nom players.
Cette activité fait partie du cours
Confidentialité des données et anonymisation en Python
Instructions de l’exercice
- Importez
PCAà partir desklearn. - Initialisez
PCA()avec un nombre de composantes égal au nombre de colonnes. - Appliquez
pcaàplayers. - Consultez l'ensemble de données obtenu.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import PCA from Scikit-learn
____
# Initialize PCA with number of components to be the same as the number of columns
pca = ____
# Apply PCA to the data
players_pca = ____
# Print the resulting dataset
print(pd.DataFrame(players_pca))