Stosowanie hierarchii dla danych kategorycznych
W tym ćwiczeniu stworzysz hierarchie i wykorzystasz je do zastosowania generalizacji danych na kolumnie bachelors ze zbioru danych US Adult Income.
Do dyspozycji masz gotowy słownik hierarchies zawierający hierarchie. Przechowuje on trzy kategorie poziomów wykształcenia: Primary, Secondary i Higher; każda zawiera listę odpowiadających im wartości z danych. Możesz swobodnie przeglądać ten słownik w konsoli interaktywnej.
Stworzysz nowy słownik, który będzie przechowywał uogólnione informacje o wykształceniu, a następnie użyjesz go do zastąpienia oryginalnych wartości.
Zbiór danych jest dostępny jako income_df.
To ćwiczenie jest częścią kursu
Prywatność danych i anonimizacja w Pythonie
Instrukcje do ćwiczenia
- Zainicjuj
education_hierarchyjako pusty słownik. - Uzupełnij wewnętrzną pętlę, przypisując typ wykształcenia
keyjako wartość. Na przykład:{'Some-college': 'Higher education'}. - Zastosuj generalizację hierarchii wykształcenia na kolumnie
bachelors, przypisując wynik do nowej kolumnybachelors_generalized.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Initialize dictionary for each education category value
education_hierarchy = ____
# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
for education in education_values:
education_hierarchy[education] = ____
# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____
# See resulting dataset
print(income_df.head())