Začněte nyníZačněte zdarma

Použití hierarchií pro kategorická data

V tomto cvičení vytvoříš a použiješ hierarchie pro aplikaci generalizace dat na sloupec bachelors z datové sady US Adult Income.

K dispozici máš výchozí slovník hierarchií pod názvem hierarchies. Obsahuje tři kategorie typů vzdělání: Primary, Secondary a Higher – každá má seznam odpovídajících hodnot vzdělání z datové sady. Klidně si ho prozkoumej v interaktivní konzoli.

Vytvoříme nový slovník, který bude uchovávat zobecněné informace o vzdělání, a použijeme ho k nahrazení původních hodnot.

Dataset je dostupný jako income_df.

Toto cvičení je součástí kurzu

Ochrana soukromí a anonymizace dat v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Inicializuj education_hierarchy jako prázdný slovník.
  • Dokonči vnitřní smyčku tak, aby byl typ vzdělání key přiřazen jako hodnota. Například {'Some-college': 'Higher education'}.
  • Aplikuj generalizaci hierarchie vzdělání na sloupec bachelors a výsledek ulož do nového sloupce bachelors_generalized.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Initialize dictionary for each education category value
education_hierarchy = ____

# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
    for education in education_values:
        education_hierarchy[education] = ____

# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____

# See resulting dataset
print(income_df.head())
Upravit a spustit kód