Appliquer la k-anonymité à un jeu de données
Dans cet exercice, vous allez anonymiser le jeu de données NBA Salaries. N'oubliez pas qu'il faut préciser les types d'attributs pour appliquer la k-anonymité. Ils peuvent être identifiants, quasi-identifiants, sensibles ou non sensibles. Nous allons nous concentrer sur age et nba_origin comme quasi-identifiants et sur salary comme donnée sensible.
Explorez nba. Si vous connaissez de l'information sur un joueur, par exemple qu'il/elle vient d'Espagne et a 23 ans, vous pourrez déduire une information sensible comme son salaire ! Ici, nous utiliserons une valeur de K égale à 3, ce qui garantit que les attributs choisis ne peuvent pas être distingués d'au moins k-1 autres lignes.
Le dictionnaire de hiérarchie pour nba_Origin est déjà créé sous le nom origin_hierarchy.
Cette activité fait partie du cours
Confidentialité des données et anonymisation en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Print how many unique combinations are for age and nba_origin
print(____)