Використання ієрархій для категоріальних даних
У цій вправі ви створите та використаєте ієрархії, щоб застосувати узагальнення даних до стовпця bachelors у наборі даних US Adult Income.
Початковий словник з ієрархіями доступний як hierarchies. Він містить три категорії типів освіти: Primary, Secondary та Higher; кожна має список відповідних значень освіти з даних. Можете переглянути його в інтерактивній консолі.
Ми створимо новий словник, який зберігатиме узагальнену інформацію про освіту і який використаємо для заміни початкових значень.
Набір даних доступний як income_df.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інструкції до вправи
- Ініціалізуйте
education_hierarchyяк порожній словник. - Доповніть внутрішній цикл, щоб присвоїти тип освіти
keyяк значення. Наприклад,{'Some-college': 'Higher education'}. - Застосуйте узагальнення за ієрархією освіти до стовпця
bachelors, записавши результат у новий стовпецьbachelors_generalized.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Initialize dictionary for each education category value
education_hierarchy = ____
# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
for education in education_values:
education_hierarchy[education] = ____
# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____
# See resulting dataset
print(income_df.head())