CommencezCommencez gratuitement

Généraliser en intervalles

La k-anonymat peut être un bon modèle de confidentialité pour certains jeux de données qui n'ont pas beaucoup de dimensions. Les deux principales techniques d'anonymisation pour transformer un jeu de données en table k-anonyme sont la généralisation et la suppression.

Dans cet exercice, vous allez transformer un jeu de données d'évaluation de la satisfaction en une table 3-anonyme contenant des attributs potentiellement sensibles comme satisfaction_rate et work_hours. Certaines combinaisons apparaissent moins de trois fois. Corrigez cela afin de rendre le DataFrame 3-anonyme.

Le DataFrame est accessible sous le nom employees. Une valeur de k égale à 3 est aussi fournie.

Cette activité fait partie du cours

Confidentialité des données et anonymisation en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Calculate how many unique combinations are for BirthYear and Department
print(employees.groupby(['birth_year','department']).____)
Modifier et exécuter le code