开始使用免费开始使用

用泛化降低识别风险

在本练习中,您将对 IBM HR Analytics Employee Attrition & Performance 数据集应用泛化。

更具体地说,您将把变量 monthly_income 转换为二元列。用于转换的阈值是工资的平均值并向上取整。对于小于或等于该整数平均值的记录,新值为 0;对于更大的记录,新值为 1。

数据集已作为 pandas 的 DataFrame hr 加载。

本练习是课程的一部分

Python 中的数据隐私与匿名化

查看课程

练习说明

  • 使用 .mean() 计算 monthly_income 列的平均值,并将其四舍五入为整数。将结果保存为 mean_income
  • hr['monthly_income'] 应用一个 lambda 函数,将收入泛化:小于或等于 mean_income 的值设为 0,大于的值设为 1。
  • 查看结果 DataFrame hr 的前 5 行。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Calculate the mean value of incomes
mean_income = ____

# Apply generalization by transforming to binary data
hr['monthly_income'] = ____

# See resulting DataFrame
print(____)
编辑并运行代码