НачатьНачать бесплатно

Использование иерархий для категориальных данных

В этом упражнении вы создадите иерархии и используете их для обобщения данных в столбце bachelors набора данных о доходах взрослого населения США.

Готовый словарь с иерархиями доступен вам под именем hierarchies. Он содержит три категории уровней образования: Primary, Secondary и Higher; для каждой из них указан список соответствующих значений из данных. Вы можете изучить его в интерактивной консоли.

Мы создадим новый словарь, который будет хранить обобщённую информацию об образовании, и используем его для замены исходных значений.

Набор данных доступен как income_df.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Инструкции к упражнению

  • Инициализируйте education_hierarchy как пустой словарь.
  • Дополните внутренний цикл так, чтобы тип образования key присваивался в качестве значения. Например: {'Some-college': 'Higher education'}.
  • Примените обобщение по иерархии образования к столбцу bachelors, сохранив результат в новый столбец bachelors_generalized.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Initialize dictionary for each education category value
education_hierarchy = ____

# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
    for education in education_values:
        education_hierarchy[education] = ____

# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____

# See resulting dataset
print(income_df.head())
Редактировать и запускать код