Utiliser des hiérarchies pour des données catégorielles
Dans cet exercice, vous allez créer et utiliser des hiérarchies pour appliquer une généralisation des données sur la colonne bachelors du jeu de données US Adult Income.
Un dictionnaire initial contenant les hiérarchies vous est fourni sous le nom hierarchies. Il regroupe trois catégories de niveaux de scolarité : Primary, Secondary et Higher; chacune possède une liste des valeurs d'éducation correspondantes dans les données. N'hésitez pas à l'explorer dans la console interactive.
Nous allons créer un nouveau dictionnaire qui contiendra l'information de scolarité généralisée et l'utiliser pour remplacer les valeurs originales.
Le jeu de données est disponible sous income_df.
Cette activité fait partie du cours
Confidentialité des données et anonymisation en Python
Instructions de l’exercice
- Initialisez
education_hierarchycomme un dictionnaire vide. - Complétez la boucle interne pour attribuer le type de scolarité
keycomme valeur. Par exemple :{'Some-college': 'Higher education'}. - Appliquez la généralisation par hiérarchie de scolarité à la colonne
bachelorset assignez le résultat à la nouvelle colonnebachelors_generalized.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Initialize dictionary for each education category value
education_hierarchy = ____
# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
for education in education_values:
education_hierarchy[education] = ____
# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____
# See resulting dataset
print(income_df.head())