开始使用免费开始使用

为安全发布准备员工数据

在处理真实数据时,您需要确保无法追溯或暴露客户或他人的个人信息。本练习将使用简化版的 IBM HR Analytics Employee 数据集,练习抑制与泛化技术。

为避免泄露有关数据集的信息,您将把列名替换为数字。

hr 已加载为 DataFrame。请使用控制台进行探索。numpy 已以 np 导入。

本练习是课程的一部分

Python 中的数据隐私与匿名化

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1) 

# Drop the rows with NaN values
df_cleaned = ____
编辑并运行代码