CommencezCommencez gratuitement

Utiliser des hiérarchies pour des données catégorielles

Dans cet exercice, vous allez créer et utiliser des hiérarchies pour appliquer une généralisation des données sur la colonne bachelors du jeu de données US Adult Income.

Un dictionnaire initial contenant les hiérarchies vous est fourni sous le nom hierarchies. Il regroupe trois catégories de niveaux de scolarité : Primary, Secondary et Higher; chacune possède une liste des valeurs d'éducation correspondantes dans les données. N'hésitez pas à l'explorer dans la console interactive.

Nous allons créer un nouveau dictionnaire qui contiendra l'information de scolarité généralisée et l'utiliser pour remplacer les valeurs originales.

Le jeu de données est disponible sous income_df.

Cette activité fait partie du cours

Confidentialité des données et anonymisation en Python

Voir le cours

Instructions de l’exercice

  • Initialisez education_hierarchy comme un dictionnaire vide.
  • Complétez la boucle interne pour attribuer le type de scolarité key comme valeur. Par exemple : {'Some-college': 'Higher education'}.
  • Appliquez la généralisation par hiérarchie de scolarité à la colonne bachelors et assignez le résultat à la nouvelle colonne bachelors_generalized.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Initialize dictionary for each education category value
education_hierarchy = ____

# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
    for education in education_values:
        education_hierarchy[education] = ____

# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____

# See resulting dataset
print(income_df.head())
Modifier et exécuter le code