Снижение риска идентификации с помощью обобщения
В этом упражнении вы примените обобщение к набору данных IBM HR Analytics Employee Attrition & Performance.
Конкретнее: вы преобразуете переменную monthly_income в бинарный столбец. В качестве порога для преобразования будет использоваться среднее значение зарплат, округлённое до целого. Новые значения: 0 — для тех, кто получает меньше среднего или равно ему, и 1 — для тех, кто получает больше.
Набор данных загружен как DataFrame hr библиотеки pandas.
Это упражнение является частью курса
Конфиденциальность данных и анонимизация в Python
Инструкции к упражнению
- Вычислите среднее значение столбца
monthly_incomeс помощью.mean()и округлите его до целого числа. Сохраните результат в переменнуюmean_income. - Примените лямбда-функцию к
hr['monthly_income'], чтобы обобщить значения доходов: 0 — для значений, меньших или равныхmean_income, и 1 — для значений, превышающих его. - Изучите первые пять строк результирующего DataFrame
hr.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)