为安全发布准备员工数据
在处理真实数据时,您需要确保无法追溯或暴露客户或他人的个人信息。本练习将使用简化版的 IBM HR Analytics Employee 数据集,练习抑制与泛化技术。
为避免泄露有关数据集的信息,您将把列名替换为数字。
hr 已加载为 DataFrame。请使用控制台进行探索。numpy 已以 np 导入。
本练习是课程的一部分
Python 中的数据隐私与匿名化
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____