在分类数据中使用层级
在本练习中,您将创建并使用层级,对 US Adult Income 数据集的 bachelors 列进行数据泛化。
已为您提供一个包含层级的初始字典 hierarchies。它包含 3 类教育类型:Primary、Secondary 和 Higher;每一类下都有该数据集中对应的教育取值列表。您可以在交互式控制台中自由探索。
我们将创建一个新字典,用于保存泛化后的教育信息,并用它来替换原始取值。
数据集已作为 income_df 提供。
本练习是课程的一部分
Python 中的数据隐私与匿名化
练习说明
- 将
education_hierarchy初始化为空字典。 - 完成内层循环,将教育类型
key作为值进行赋值。例如{'Some-college': 'Higher education'}。 - 将教育层级泛化应用到
bachelors列,并将结果赋给新列bachelors_generalized。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Initialize dictionary for each education category value
education_hierarchy = ____
# Create hierachy for each of the education category values
for (key,education_values) in hierarchies.items():
for education in education_values:
education_hierarchy[education] = ____
# Apply education_hierarchy generalization to bachelors
income_df['bachelors_generalized'] = ____
# See resulting dataset
print(income_df.head())