CommencezCommencez gratuitement

Préparer des données d'employés pour une diffusion sécuritaire

Quand vous travaillez avec de véritables données, vous devez vous assurer qu'il est impossible de retracer ou de révéler les renseignements personnels de vos clients ou d'autres personnes. Dans cet exercice, vous utiliserez une version simplifiée de l'ensemble de données IBM HR Analytics Employee pour vous exercer aux techniques de suppression et de généralisation.

Pour éviter toute fuite d'information au sujet de l'ensemble de données, vous remplacerez les noms de colonnes par des numéros.

Le DataFrame est déjà chargé sous le nom hr. Servez-vous de la console pour l'explorer. numpy est importé sous le nom np.

Cette activité fait partie du cours

Confidentialité des données et anonymisation en Python

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1) 

# Drop the rows with NaN values
df_cleaned = ____
Modifier et exécuter le code