Использование иерархий для категориальных данных
В этом упражнении вы создадите иерархии и используете их для обобщения данных в столбце bachelors набора данных о доходах взрослого населения США.
Готовый словарь с иерархиями доступен вам под именем hierarchies. Он содержит три категории уровней образования: Primary, Secondary и Higher; для каждой из них указан список соответствующих значений из данных. Вы можете изучить его в интерактивной консоли.
Мы создадим новый словарь, который будет хранить обобщённую информацию об образовании, и используем его для замены исходных значений.
Набор данных доступен как income_df.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Инструкции к упражнению
- Инициализируйте
education_hierarchyкак пустой словарь. - Дополните внутренний цикл так, чтобы тип образования
keyприсваивался в качестве значения. Например:{'Some-college': 'Higher education'}. - Примените обобщение по иерархии образования к столбцу
bachelors, сохранив результат в новый столбецbachelors_generalized.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Initialize dictionary for each education category value
education_hierarchy = ____
# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
for education in education_values:
education_hierarchy[education] = ____
# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____
# See resulting dataset
print(income_df.head())