Réduire le risque d'identification par généralisation
Dans cet exercice, vous allez appliquer la généralisation sur le jeu de données IBM HR Analytics Employee Attrition & Performance.
Plus précisément, vous transformerez la variable monthly_income en une colonne binaire. Le seuil à utiliser pour la transformation sera la valeur moyenne des salaires, arrondie à l'entier supérieur. Les nouvelles valeurs seront 0 pour celles qui sont inférieures ou égales à la moyenne entière, et 1 pour celles qui sont supérieures.
Le jeu de données est chargé dans un DataFrame pandas nommé hr.
Cette activité fait partie du cours
Confidentialité des données et anonymisation en Python
Instructions de l’exercice
- Calculez la valeur moyenne de la colonne
monthly_incomeavec.mean()et arrondissez-la à un entier. Enregistrez-la dansmean_income. - Appliquez une fonction
lambdaàhr['monthly_income']pour généraliser les revenus à 0 pour les valeurs inférieures ou égales àmean_income, et à 1 pour celles qui sont supérieures. - Explorez les cinq premières lignes du DataFrame
hrobtenu.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)