Вибірка з найкращого неперервного розподілу
Випадкова вибірка з добре підібраного ймовірнісного розподілу допомагає зберегти приватність. Водночас це дає змогу уповноваженим сторонам виконувати точний статистичний аналіз даних.
У цій вправі ви анонімізуєте стовпець monthly_income з набору даних IBM. У попередньому уроці ви визначили, що найкраще підходить неперервний розподіл exponnorm. Використайте його, щоб змоделювати доходи.
Набір даних доступний як hr.
Ця вправа є частиною курсу
Конфіденційність даних і анонімізація в Python
Інструкції до вправи
- Імпортуйте модуль
statsз пакетаscipy. - Підійміть (fit) розподіл
exponnormдо неперервної змінноїmonthly_income, щоб отримати параметри розподілу та згодом згенерувати вибірки. - Зробіть вибірку з розподілу
exponnormі замінітьmonthly_income, використовуючи метод.rvs(). Вкажіть розмір, який дорівнює довжині стовпця. - Округліть зарплати до найближчого цілого.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import stats from scipy
____
# Fit the exponnorm distribution to the continuous variable monthly income
params = ____
# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____
# Round the salaries to their closest integer
hr['monthly_income'] = ____
# See the resulting dataset
print(hr.head())