Подготовка данных о сотрудниках к безопасной публикации
При работе с реальными данными важно убедиться, что личная информация клиентов и других людей не может быть отслежена или раскрыта. В этом упражнении вы будете использовать упрощённую версию набора данных IBM HR Analytics Employee, чтобы отработать методы подавления и обобщения данных.
Чтобы исключить утечку информации о наборе данных, вы заменяете названия столбцов числами.
DataFrame загружен как hr — используйте консоль для его изучения. numpy импортирован как np.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Drop unique data and almost unique data
df_dropped = ____(["employee_number", "monthly_income", "monthly_rate", "daily_rate"], axis=1)
# Drop the rows with NaN values
df_cleaned = ____