ПочатиПочніть безкоштовно

Вибірка з найкращого неперервного розподілу

Випадкова вибірка з добре підібраного ймовірнісного розподілу допомагає зберегти приватність. Водночас це дає змогу уповноваженим сторонам виконувати точний статистичний аналіз даних.

У цій вправі ви анонімізуєте стовпець monthly_income з набору даних IBM. У попередньому уроці ви визначили, що найкраще підходить неперервний розподіл exponnorm. Використайте його, щоб змоделювати доходи.

Набір даних доступний як hr.

Ця вправа є частиною курсу

Конфіденційність даних і анонімізація в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте модуль stats з пакета scipy.
  • Підійміть (fit) розподіл exponnorm до неперервної змінної monthly_income, щоб отримати параметри розподілу та згодом згенерувати вибірки.
  • Зробіть вибірку з розподілу exponnorm і замініть monthly_income, використовуючи метод .rvs(). Вкажіть розмір, який дорівнює довжині стовпця.
  • Округліть зарплати до найближчого цілого.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import stats from scipy
____

# Fit the exponnorm distribution to the continuous variable monthly income
params = ____

# Sample from the exponnorm distribution and replace monthly income
hr['monthly_income'] = ____

# Round the salaries to their closest integer
hr['monthly_income'] = ____

# See the resulting dataset
print(hr.head())
Редагувати та запускати код