Підготовка даних про працівників до безпечного оприлюднення
Працюючи з реальними даними, потрібно бути певними, що немає жодного способу відстежити або розкрити особисту інформацію наших клієнтів чи інших людей. У цій вправі ви використаєте спрощену версію набору даних IBM HR Analytics Employee, щоб попрактикуватися у методах придушення та узагальнення.
Щоб уникнути витоку інформації про набір даних, ви заміните назви стовпців на числа.
Датафрейм завантажено як hr, скористайтеся консоллю, щоб його дослідити. numpy імпортовано як np.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____