НачатьНачать бесплатно

Снижение риска идентификации с помощью обобщения

В этом упражнении вы примените обобщение к набору данных IBM HR Analytics Employee Attrition & Performance.

Конкретнее: вы преобразуете переменную monthly_income в бинарный столбец. В качестве порога для преобразования будет использоваться среднее значение зарплат, округлённое до целого. Новые значения: 0 — для тех, кто получает меньше среднего или равно ему, и 1 — для тех, кто получает больше.

Набор данных загружен как DataFrame hr библиотеки pandas.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Инструкции к упражнению

  • Вычислите среднее значение столбца monthly_income с помощью .mean() и округлите его до целого числа. Сохраните результат в переменную mean_income.
  • Примените лямбда-функцию к hr['monthly_income'], чтобы обобщить значения доходов: 0 — для значений, меньших или равных mean_income, и 1 — для значений, превышающих его.
  • Изучите первые пять строк результирующего DataFrame hr.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Calculate the mean value of incomes
mean_income = ____

# Apply generalization by transforming to binary data
hr['monthly_income'] = ____

# See resulting DataFrame
print(____)
Редактировать и запускать код