开始使用免费开始使用

在分类数据中使用层级

在本练习中,您将创建并使用层级,对 US Adult Income 数据集的 bachelors 列进行数据泛化。

已为您提供一个包含层级的初始字典 hierarchies。它包含 3 类教育类型:PrimarySecondaryHigher;每一类下都有该数据集中对应的教育取值列表。您可以在交互式控制台中自由探索。

我们将创建一个新字典,用于保存泛化后的教育信息,并用它来替换原始取值。

数据集已作为 income_df 提供。

本练习是课程的一部分

Python 中的数据隐私与匿名化

查看课程

练习说明

  • education_hierarchy 初始化为空字典。
  • 完成内层循环,将教育类型 key 作为值进行赋值。例如 {'Some-college': 'Higher education'}
  • 将教育层级泛化应用到 bachelors 列,并将结果赋给新列 bachelors_generalized

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Initialize dictionary for each education category value
education_hierarchy = ____

# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
    for education in education_values:
        education_hierarchy[education] = ____

# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____

# See resulting dataset
print(income_df.head())
编辑并运行代码