CommencezCommencez gratuitement

Réduire le risque d'identification par généralisation

Dans cet exercice, vous allez appliquer la généralisation sur le jeu de données IBM HR Analytics Employee Attrition & Performance.

Plus précisément, vous transformerez la variable monthly_income en une colonne binaire. Le seuil à utiliser pour la transformation sera la valeur moyenne des salaires, arrondie à l'entier supérieur. Les nouvelles valeurs seront 0 pour celles qui sont inférieures ou égales à la moyenne entière, et 1 pour celles qui sont supérieures.

Le jeu de données est chargé dans un DataFrame pandas nommé hr.

Cette activité fait partie du cours

Confidentialité des données et anonymisation en Python

Voir le cours

Instructions de l’exercice

  • Calculez la valeur moyenne de la colonne monthly_income avec .mean() et arrondissez-la à un entier. Enregistrez-la dans mean_income.
  • Appliquez une fonction lambda à hr['monthly_income'] pour généraliser les revenus à 0 pour les valeurs inférieures ou égales à mean_income, et à 1 pour celles qui sont supérieures.
  • Explorez les cinq premières lignes du DataFrame hr obtenu.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Calculate the mean value of incomes
mean_income = ____

# Apply generalization by transforming to binary data
hr['monthly_income'] = ____

# See resulting DataFrame
print(____)
Modifier et exécuter le code