Зменшення ризику ідентифікації за допомогою узагальнення
У цій вправі ви застосуєте узагальнення до набору даних IBM HR Analytics Employee Attrition & Performance.
Зокрема, ви перетворите змінну monthly_income на бінарний стовпець. Порогом для цього перетворення буде середнє значення зарплат, заокруглене вгору. Нові значення будуть 0 для тих, що менші або дорівнюють цілому середньому, і 1 для більших за нього.
Набір даних завантажено як датафрейм pandas hr.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інструкції до вправи
- Обчисліть середнє значення стовпця
monthly_incomeза допомогою.mean()і заокругліть його до цілого. Збережіть якmean_income. - Застосуйте функцію
lambdaдоhr['monthly_income'], щоб узагальнити доходи: 0 для значень, що менші або дорівнюютьmean_income, і 1 для більших. - Перегляньте перші п'ять рядків підсумкового датафрейму
hr.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Calculate the mean value of incomes
mean_income = ____
# Apply generalization by transforming to binary data
hr['monthly_income'] = ____
# See resulting DataFrame
print(____)