用泛化降低识别风险
在本练习中,您将对 IBM HR Analytics Employee Attrition & Performance 数据集应用泛化。
更具体地说,您将把变量 monthly_income 转换为二元列。用于转换的阈值是工资的平均值并向上取整。对于小于或等于该整数平均值的记录,新值为 0;对于更大的记录,新值为 1。
数据集已作为 pandas 的 DataFrame hr 加载。
本练习是课程的一部分
Python 中的数据隐私与匿名化
练习说明
- 使用
.mean()计算monthly_income列的平均值,并将其四舍五入为整数。将结果保存为mean_income。 - 对
hr['monthly_income']应用一个lambda函数,将收入泛化:小于或等于mean_income的值设为 0,大于的值设为 1。 - 查看结果 DataFrame
hr的前 5 行。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)