对数据集进行 K-匿名化
在本练习中,您将对 NBA 薪资数据集进行匿名化处理。请记住,应用 k-匿名需要指定属性类型:可识别、准识别、敏感或非敏感。我们将把 age 和 nba_origin 设为准识别属性,把 salary 设为敏感数据。
先探索 nba。如果您知道某位球员的信息,例如来自西班牙且年龄为 23 岁,那么您就可能推断出他的敏感信息(如薪资)!这里我们将使用 K 值为 3,确保所选属性与至少 k-1 行无法区分。
nba_Origin 的层级字典已创建为 origin_hierarchy。
本练习是课程的一部分
Python 中的数据隐私与匿名化
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Print how many unique combinations are for age and nba_origin
print(____)