НачатьНачать бесплатно

Выборка из того же вероятностного распределения

Многие организации, в том числе Бюро переписи населения США, публично публикуют выборки данных, собранных о частных лицах. Сначала такие наборы данных анонимизируются с помощью различных методов, а затем публикуется небольшая часть — от 1% до 5% от общего объёма — для проведения вычислений. Выборка позволяет сохранить статистические характеристики данных, что даёт возможность изучать и анализировать генеральную совокупность.

В этом упражнении вы анонимизируете столбец department из набора данных IBM HR, выполнив выборку на основе распределений исходного набора данных.

Набор данных загружен в переменную hr.

Это упражнение является частью курса

Конфиденциальность данных и анонимизация в Python

Посмотреть курс

Инструкции к упражнению

  • Получите относительные частоты для каждого уникального значения в столбце department.
  • Извлеките вероятности из counts и сохраните их в переменную distributions.
  • Выполните выборку на основе ранее вычисленных вероятностных распределений. Размер выборки должен совпадать с размером набора данных hr.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Obtain the probability distribution counts 
counts = ____

# Get the probability distribution values 
distributions = ____

# Sample from the calculated probability distributions
hr['department'] = np.random.choice(counts.index, 
                                    p=____, 
                                    size=len(____))

# See the resulting DataFrame
print(hr.head())
Редактировать и запускать код