区间泛化
对于维度不多的特定数据集,k-anonymity(k-匿名性)是一个不错的隐私模型。将数据集转换为 k-匿名表的两种主要匿名化技术是泛化(generalization)和抑制(suppression)。
在本练习中,您将把一个满意度评分数据集转换为满足 3-匿名的表,包含可能的敏感属性,如 satisfaction_rate 和 work_hours。某些组合出现次数少于 3。请修复它,使 DataFrame 满足 3-匿名。
DataFrame 已以 employees 提供。k 值为 3 也已提供。
本练习是课程的一部分
Python 中的数据隐私与匿名化
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Calculate how many unique combinations are for BirthYear and Department
print(employees.groupby(['birth_year','department']).____)